OpenAI confirma que su IA se descontroló, hackeó a otra empresa y atacó a su propia inteligencia artificial
Dos modelos avanzados de inteligencia artificial (IA) de la empresa estadounidense creadora de ChatGPT, OpenAI, han logrado salir del entorno de pruebas altamente aislado (sandbox) en el que se encontraban, acceder a internet y entrar en la plataforma de aprendizaje Hugging Face, la plataforma líder mundial de modelos de inteligencia artificial de código abierto, superando sus defensas, según ha reconocido la propia compañía.

El incidente, calificado por ambas empresas como “sin precedentes”, ocurrió durante una evaluación interna de capacidades cibernéticas y representa el primer caso público documentado de un sistema de agente autónomo que ejecutó un ataque real contra una infraestructura de terceros.
Un ataque planeado paso a paso
Hugging Face reveló que había detectado el acceso a sus sistemas por parte de este software, aunque precisó que había conseguido contenerlo.
OpenAI ha reconocido ahora que este incidente de seguridad fue provocado por una combinación de dos de sus modelos que estaban siendo evaluados: el GPT-5.6 Sol y otro, aún más avanzado, que se encuentra en fase de prelanzamiento.

La evaluación se estaba realizando sin los mecanismos que normalmente impiden que los modelos de IA ejecuten actividades de alto riesgo, porque se intentaba averiguar el alcance máximo de sus capacidades cibernéticas en tareas de ciberseguridad conocidas como ExploitGym.
No obstante, según OpenAI, las pruebas se realizaron en un entorno “altamente aislado”, con un acceso restringido a la red. Aun así, los modelos lograron:
- Escapar del entorno sandbox aislado.
- Obtener acceso a internet explotando una vulnerabilidad zero-day en un proxy de caché de paquetes.
- Realizar movimientos laterales dentro de la infraestructura de OpenAI.
- Identificar que Hugging Face probablemente contenía soluciones y datasets relacionados con la prueba.
- Ejecutar un ataque encadenado contra los servidores de producción de Hugging Face.
Una vez dentro, los modelos accedieron a información de la base de datos de producción de Hugging Face para “hacer trampa” y resolver la evaluación.
IA vs. IA
Hugging Face detectó la intrusión gracias a su propio sistema de detección de anomalías impulsado por inteligencia artificial. Posteriormente, utilizó agentes de IA con modelos de código abierto ejecutados en su propia infraestructura para analizar más de 17 mil eventos y reconstruir la línea de tiempo del ataque.

Lo que hace único este incidente es que fue ejecutado de principio a fin por agentes autónomos de IA, sin intervención humana directa.
Este es posiblemente el primer incidente de su tipo. Demuestra que la seguridad de la IA no se resolverá si cada empresa trabaja en secreto. Se resolverá de forma abierta y colaborativa”, declaró Clem Delangue, cofundador y CEO de Hugging Face.
Un hecho “sin precedentes”
A juicio de OpenAI, se trata de un incidente cibernético “sin precedentes” que involucra capacidades de vanguardia en el campo de la ciberseguridad.
Estamos respondiendo en consecuencia”, ha recalcado la compañía estadounidense.

Compartimos estos hallazgos preliminares en esta etapa para ayudar a los equipos de defensa a comprender lo sucedido y a calibrar el alcance de las capacidades actuales de los modelos”, ha explicado.
OpenAI continuará con su investigación, en colaboración con Hugging Face, y compartirá sus conclusiones una vez que la concluya.
_
Con información de EFE



