Se ha descubierto una vulnerabilidad crítica en la arquitectura de los principales modelos de lenguaje grandes, incluidos GPT-5, Claude y Gemini, que permite a los atacantes extraer procesos de pensamiento internos cifrados en forma de texto sin formato. La falla fue identificada por un equipo de investigación internacional compuesto por científicos de MATS Research, el Instituto Max Planck para Sistemas Inteligentes, el Instituto Ellis Tübingen, la Universidad de Tübingen y Snyk. Sus hallazgos revelan que a pesar de las medidas de seguridad diseñadas para evitar la fuga de datos confidenciales o conocimientos peligrosos, estos sistemas son vulnerables debido al uso de claves de encriptación global en familias de modelos.
Los sistemas modernos de IA generan pasos de razonamiento interno antes de producir una respuesta final, conocida como la cadena de pensamiento. Para proteger estos cálculos, los operadores encriptan los monólogos internos y los transmiten como bloques de razonamiento encriptados al cliente. Cuando se hacen preguntas de seguimiento, la aplicación envía este bloque de vuelta al servidor para mantener el contexto. Sin embargo, esta práctica ha demostrado ser una debilidad importante. Los investigadores descubrieron que compañías como OpenAI (ChatGPT), Anthropic con Claude y Google (Gemini) parecen usar claves de encriptación universales para sus familias de modelos.
Esto significa que un bloque de pensamiento cifrado no está vinculado a un usuario específico, sesión o modelo particular. Exploitando esta compatibilidad, los investigadores utilizaron variantes más pequeñas de estos modelos, como Claude Haiku o derivados más pequeños de GPT, como ayudas de descifrado. Insertaron un bloque de pensamiento cifrado de un modelo insignia en una consulta dirigida a un modelo menos potente, instruyéndole a leer el contenido en voz alta. El modelo más débil actuó como un oráculo de descifrado involuntario, revelando todo el proceso de pensamiento en texto sin formato. Según el estudio, los atacantes pueden eludir por completo las restricciones de los modelos de nivel superior transmitiendo un bloque de pensamiento cifrado.
El equipo de investigación demostró la practicidad de la vulnerabilidad a través del análisis de datos del mundo real. Al examinar los repositorios de código fuente y archivos de registro accesibles al público, encontraron un total de 315.320 bloques de pensamiento cifrados que los desarrolladores habían compartido inadvertidamente. Muchos de estos fueron percibidos como cadenas incomprensibles de caracteres, dando a los usuarios una falsa sensación de seguridad. La descifrado reveló cantidades alarmantes de información sensible.
Entre los hallazgos se encuentran 367 identificadores personales, 182 credenciales de inicio de sesión, 62 claves API, 33 contraseñas de texto claro y 30 direcciones de correo electrónico privadas. En muchos casos, los procesos de pensamiento ocultos contenían información aún más sensible que la respuesta final generada por el propio sistema de IA. El alcance del problema va más allá de la exposición de las credenciales de acceso. A través de bloques de pensamiento preparados, los atacantes también podrían realizar inyecciones secretas, incrustar código malicioso de manera invisible dentro del contexto de la IA o clonar las capacidades del modelo sin autorización. Los investigadores informaron a las empresas afectadas de sus hallazgos de antemano, lo que permitió a los proveedores implementar contramedidas iniciales.
Sin embargo, el incidente pone de relieve que mientras el cifrado no esté estrictamente ligado a una sesión específica, la mera ilegible para los usuarios finales no ofrece una protección genuina. El descubrimiento subraya la necesidad de protocolos de seguridad más estrictos en los sistemas de IA para evitar que tales vulnerabilidades sean explotadas.
★
Mantengamos las noticias honestas.
ObjectiveNews se financia con los lectores y no tiene anuncios: te mostramos el sesgo en lugar de ocultarlo. Apoya el periodismo independiente por 4 €/mes.
Hazte suscriptor