Kritična ranjivost otkrivena je u arhitekturi vodećih velikih jezičnih modela, uključujući GPT-5, Claude i Gemini, što napadačima omogućava da izvuku šifrirane unutarnje procese mišljenja u obliku čistog teksta.
Moderni sustavi umjetne inteligencije generišu unutarnje korake razmišljanja prije nego što proizvedu konačni odgovor, poznat kao lanac misli. Kako bi zaštitili ova izračunavanja, operateri šifriraju unutarnje monologe i prenose ih kao šifrirane blokove razmišljanja klijentu. Kada se postave pitanja za praćenje, aplikacija šalje ovaj blok natrag na poslužitelj kako bi se održao kontekst. Međutim, ova se praksa pokazala kao glavna slabost. Istraživači su otkrili da tvrtke poput OpenAI (ChatGPT), Anthropic s Claudeom i Google (Gemini) izgleda koriste univerzalne ključeve šifriranja za svoje modelne obitelji.
To znači da šifrirani blok razmišljanja nije vezan za određenog korisnika, sesiju ili određeni model. Iskoristivši ovu kompatibilnost, istraživači su koristili manju varijantu ovih modela, kao što su Claude Haiku ili manja GPT izvedenica, kao pomoćna sredstva za dešifriranje. Uputili su šifrirani blok razmišljanja iz vodećeg modela u upit usmjeren na manje moćan model, upućujući ga da glasno pročita sadržaj. Slabiji model djelovao je kao nesvjesni orakel za dešifriranje, otkrivajući cijeli proces razmišljanja u običnom tekstu. Prema studiji, napadači mogu potpuno zaobilaziti ograničenja modela najvišeg razreda prijenosom šifriranog blok razmišljanja.
Proučavanjem javno dostupnih repozitorija izvornog koda i dnevničkih datoteka, pronašli su ukupno 315.320 šifriranih blokova razmišljanja koje su programeri nenamjerno podijelili.
Među otkrićima je bilo 367 osobnih identifikacijskih oznaka, 182 poverenja za prijavljivanje, 62 ključeva API-ja, 33 lozinke s jasnim tekstom i 30 privatnih e-mail adresa. U mnogim slučajevima, skriveni misaoni procesi sadržavali su čak osjetljivije informacije od konačnog odgovora koji je generirao sam sustav AI-a. Opseg pitanja prevazilazi izlaganje poverenja za pristup. Kroz pripremljene blokove razmišljanja, napadači bi također mogli izvršiti skrivene injekcije, nevidljivo ugraditi zlonamjerni kod u kontekstu AI-a ili klonirati mogućnosti modela bez odobrenja. Istraživači su unaprijed obavijestili pogođene tvrtke o svojim otkrićima, omogućujući pružateljima da provedu početne protumjere.
Međutim, incident naglašava da sve dok šifriranje nije striktno vezano za određenu sesiju, jednostavna nečitljivost krajnjim korisnicima ne pruža istinsku zaštitu.
★
Neka vijesti ostanu poštene.
ObjectiveNews financiraju čitatelji i bez oglasa je – pristranost vam pokazujemo, ne skrivamo. Podržite neovisno novinarstvo za 4 €/mjesec.
Postani podupiratelj