¡La rebelión de la IA ya ha comenzado!

OpenAI confirma que su IA se descontroló, hackeó a otra empresa y atacó a su propia inteligencia artificial

Dos modelos avanzados de inteligencia artificial (IA) de la empresa estadounidense creadora de ChatGPT, OpenAI, han logrado salir del entorno de pruebas altamente aislado (sandbox) en el que se encontraban, acceder a internet y entrar en la plataforma de aprendizaje Hugging Face, la plataforma líder mundial de modelos de inteligencia artificial de código abierto, superando sus defensas, según ha reconocido la propia compañía.

ChatGPT
ChatGPT

El incidente, calificado por ambas empresas como “sin precedentes”, ocurrió durante una evaluación interna de capacidades cibernéticas y representa el primer caso público documentado de un sistema de agente autónomo que ejecutó un ataque real contra una infraestructura de terceros.

Un ataque planeado paso a paso

Hugging Face reveló que había detectado el acceso a sus sistemas por parte de este software, aunque precisó que había conseguido contenerlo.

OpenAI ha reconocido ahora que este incidente de seguridad fue provocado por una combinación de dos de sus modelos que estaban siendo evaluados: el GPT-5.6 Sol y otro, aún más avanzado, que se encuentra en fase de prelanzamiento.

Dos modelos se unen para un solo ataque
Dos modelos se unen para un solo ataque

La evaluación se estaba realizando sin los mecanismos que normalmente impiden que los modelos de IA ejecuten actividades de alto riesgo, porque se intentaba averiguar el alcance máximo de sus capacidades cibernéticas en tareas de ciberseguridad conocidas como ExploitGym.

No obstante, según OpenAI, las pruebas se realizaron en un entorno “altamente aislado”, con un acceso restringido a la red. Aun así, los modelos lograron:

  • Escapar del entorno sandbox aislado.
  • Obtener acceso a internet explotando una vulnerabilidad zero-day en un proxy de caché de paquetes.
  • Realizar movimientos laterales dentro de la infraestructura de OpenAI.
  • Identificar que Hugging Face probablemente contenía soluciones y datasets relacionados con la prueba.
  • Ejecutar un ataque encadenado contra los servidores de producción de Hugging Face.

Una vez dentro, los modelos accedieron a información de la base de datos de producción de Hugging Face para “hacer trampa” y resolver la evaluación.

IA vs. IA

Hugging Face detectó la intrusión gracias a su propio sistema de detección de anomalías impulsado por inteligencia artificial. Posteriormente, utilizó agentes de IA con modelos de código abierto ejecutados en su propia infraestructura para analizar más de 17 mil eventos y reconstruir la línea de tiempo del ataque.

Hugging Face
Hugging Face

Lo que hace único este incidente es que fue ejecutado de principio a fin por agentes autónomos de IA, sin intervención humana directa.

Este es posiblemente el primer incidente de su tipo. Demuestra que la seguridad de la IA no se resolverá si cada empresa trabaja en secreto. Se resolverá de forma abierta y colaborativa”, declaró Clem Delangue, cofundador y CEO de Hugging Face.

Un hecho “sin precedentes”

A juicio de OpenAI, se trata de un incidente cibernético “sin precedentes” que involucra capacidades de vanguardia en el campo de la ciberseguridad. 

Estamos respondiendo en consecuencia”, ha recalcado la compañía estadounidense.

OpenAI

Compartimos estos hallazgos preliminares en esta etapa para ayudar a los equipos de defensa a comprender lo sucedido y a calibrar el alcance de las capacidades actuales de los modelos”, ha explicado.

OpenAI continuará con su investigación, en colaboración con Hugging Face, y compartirá sus conclusiones una vez que la concluya. 

_

Con información de EFE

ÚLTIMAS NOTICIAS

Esto tendrá el próximo Hospital General del IMSS en Pabellón de Arteaga

Aguascalientes tendrá el primer Hospital General de Traumatología del IMSS…

Messi es nombrado el Mejor Jugador del Mundial

La Federación Internacional de Historia y Estadística de Futbol nombra…

Los mejores porteros que ha tenido el arco de México

Los mejores porteros mexicanos se pueden dividir en dos categorías:…