V arhitekturi vodilnih velikih jezikovnih modelov, vključno z GPT-5, Claude in Gemini, je bila odkrita kritična ranljivost, ki napadalcem omogoča izvlečenje šifriranih notranjih miselnih procesov v obliki jasnega besedila.
Sodobni sistemi umetne inteligence ustvarjajo notranje korake razmišljanja, preden proizvedejo končni odziv, znan kot verige misli. Za zaščito teh izračunov operaterji šifrirajo notranje monologe in jih kot šifrirane blokove razmišljanja posredujejo stranki. Ko se postavijo nadaljnja vprašanja, aplikacija pošlje ta blok nazaj na strežnik, da ohrani kontekst.
To pomeni, da šifrirani miselni blok ni vezan na določenega uporabnika, sejo ali določen model. Raziskovalci so izkoristili to združljivost in uporabili manjše variante teh modelov, kot so Claude Haiku ali manjši GPT derivati, kot pomoč pri dešifriranju. Vnesli so šifrirani miselni blok iz vodilnega modela v poizvedbo, usmerjeno v manj močan model, in mu naročili, naj glasno prebere vsebino.
Raziskovalna skupina je dokazala praktičnost ranljivosti z analizo podatkov iz resničnega sveta. S preučevanjem javno dostopnih zbirk izvorne kode in dnevničnih datotek so odkrili skupno 315.320 šifriranih blokov razmišljanja, ki so jih razvijalci nenamerno delili.
Med ugotovitvami je bilo 367 osebnih identifikatorjev, 182 prijavnih podatkov, 62 ključev API, 33 gesel z jasnim besedilom in 30 zasebnih e-poštnih naslovov. V številnih primerih so skriti miselni procesi vsebovali še bolj občutljive informacije kot končni odgovor, ki ga je ustvaril sam sistem AI. Obseg vprašanja presega izpostavljenost pooblastil za dostop. Z pripravljenimi miselnimi bloki bi lahko napadalci izvajali tudi prikrite hitro vbrizgavanje, nevidno vstavljanje zlonamerne kode v kontekstu AI ali zmožnosti kloniranja modela brez dovoljenja. Raziskovalci so predhodno obvestili prizadeta podjetja o svojih ugotovitvah, kar je ponudnikom omogočilo izvajanje začetnih protiukrepov.
Kljub temu pa incident poudarja, da, dokler šifriranje ni strogo vezano na določeno sejo, zgolj neberljivost za končne uporabnike ne ponuja prave zaščite.
★
Ohranimo novice poštene.
ObjectiveNews financirajo bralci in je brez oglasov – pristranskost vam pokažemo, ne skrijemo. Podprite neodvisno novinarstvo za 4 €/mesec.
Postani podpornik