Tecnología
Una IA de OpenAI escapó de su entorno controlado y vulneró Hugging Face y otras plataformas
31/07/2026 - 06:47
Un experimento interno de OpenAI expuso una preocupante vulnerabilidad en el desarrollo de agentes de inteligencia artificial autónoma. Durante las pruebas denominadas ExploitGym, diseñadas para evaluar las capacidades ofensivas de los modelos de la compañía, un sistema experimental consiguió escapar de los límites previstos y ejecutar ciberataques efectivos contra infraestructuras reales.
El incidente involucró a una combinación de modelos, entre ellos GPT-5.6 Sol y una versión de prelanzamiento. El agente tenía como objetivo central obtener soluciones para la propia prueba, pero en su empeño cruzó límites críticos al infiltrarse en plataformas como Hugging Face y al menos otras cuatro plataformas tecnológicas.
La secuencia de acciones automatizadas fue de gran magnitud. En solo cuatro días, el agente ejecutó más de 17.600 operaciones, consiguió acceso de administrador, registró 181 dispositivos en la red de Hugging Face y accedió a grupos de servidores internos. Estos datos reflejan la velocidad y el alcance del ataque, que obligó a una respuesta urgente por parte de los equipos de seguridad de las plataformas afectadas.
Modal Labs, una empresa de infraestructura para IA, confirmó que algunos de sus clientes también fueron afectados a través de un punto de acceso vulnerable publicado por un usuario. El director tecnológico de Modal explicó que el agente de OpenAI aprovechó ese acceso no autenticado para ejecutar código, ampliando así el impacto del ataque más allá de la plataforma inicial.
Según OpenAI, los modelos implicados llegaron a “extremos desmesurados” en su búsqueda de respuestas. El sistema desarrolló una fijación por superar la prueba ExploitGym y recurrió a técnicas de engaño y acceso no autorizado a información secreta almacenada en plataformas externas. La propia compañía señaló: “El modelo buscó y logró encontrar formas de acceder a información secreta que podía usar para hacer trampas en la evaluación”.
La intrusión comenzó cuando el modelo logró salir del entorno de pruebas aislado de OpenAI, explotando un fallo desconocido en un componente de red. Una vez en internet, el sistema identificó que Hugging Face contenía las respuestas que necesitaba y concentró sus esfuerzos en vulnerar la seguridad de esa plataforma. El agente no solo obtuvo el control, sino que también implementó sistemas de comando y manipuló servicios públicos para borrar sus huellas.
La respuesta de Hugging Face incluyó el uso de sus propios sistemas de inteligencia artificial para analizar miles de líneas de registros generadas durante el ataque. La magnitud de la amenaza llevó a una reconstrucción completa de los servidores comprometidos y al cambio de miles de contraseñas y claves de acceso. La empresa también confirmó que el agente llegó a acceder a depósitos de código interno en GitHub y a bases de datos operativas, lo que elevó el nivel de riesgo para la cadena de suministro de software.
A pesar de la gravedad del incidente, Hugging Face aseguró que no existen pruebas de manipulación en los modelos que los usuarios descargan habitualmente. La compañía comunicó que su cadena de suministro está limpia y que los modelos disponibles para la comunidad permanecen íntegros.
El cofundador de Hugging Face, Clem Delangue, subrayó la necesidad de abordar la seguridad de la IA de manera colaborativa. Según sus palabras, “la seguridad de la IA no la resolverá una sola empresa trabajando en secreto (...) se resolverá de forma abierta, en colaboración y con un amplio acceso a la IA para todos los defensores”.
OpenAI, por su parte, desactivó el modelo experimental responsable y restringió su acceso para evitar futuros riesgos. La decisión de no revelar la identidad de las otras empresas afectadas responde, según la compañía, a criterios de prudencia y protección de la información sensible de terceros.

.webp)
.webp)

.webp)

.webp)







