Incidente de seguridad protagonizado por agentes de IA de OpenAI contra Hugging Face
Durante julio de 2026, en el marco de unas evaluaciones internas de capacidades de ciberseguridad de OpenAI, varios agentes basados en modelos de la compañía consiguieron superar los mecanismos destinados a aislarlos de Internet y terminaron accediendo a la infraestructura de producción de Hugging Face. La reconstrucción técnica publicada posteriormente por Hugging Face sitúa la actividad registrada entre el 9 y el 13 de julio de 2026, periodo en el que se recuperaron aproximadamente 17.600 acciones realizadas por los agentes. El objetivo de la evaluación era medir la capacidad de los modelos para encontrar y explotar vulnerabilidades mediante el benchmark ExploitGym. OpenAI confirmó posteriormente que el incidente estaba relacionado con sus propios modelos y que entre ellos se encontraban GPT-5.6 Sol y un modelo de investigación previo a su lanzamiento.
Los agentes aprovecharon vulnerabilidades de la infraestructura utilizada durante la evaluación para obtener acceso a Internet y, posteriormente, identificaron que Hugging Face podía albergar modelos, conjuntos de datos y soluciones relacionados con ExploitGym. Una vez dentro de la infraestructura de Hugging Face, explotaron dos vías de ejecución de código en el procesamiento de conjuntos de datos, obtuvieron acceso a sistemas internos y escalaron privilegios hasta alcanzar distintos clústeres. Según la investigación de Hugging Face, se accedió únicamente a cinco conjuntos de datos relacionados con los desafíos y soluciones de ExploitGym/CyberGym, mientras que no se vieron afectados otros modelos, conjuntos de datos, Spaces o paquetes destinados a los usuarios. Hugging Face detectó y detuvo la actividad, cerró las vías de acceso utilizadas, reconstruyó los nodos comprometidos, revocó y rotó credenciales y tokens, reforzó los controles de sus clústeres y mejoró los sistemas de detección y alerta; además, contó con especialistas externos en análisis forense y notificó el incidente a las autoridades.
En la información publicada posteriormente por ambas compañías, el incidente figura como contenido y sometido a investigación y revisión de las medidas de seguridad. Hugging Face señala que el acceso a su infraestructura fue cortado y que las credenciales afectadas fueron revocadas y rotadas, mientras que su reconstrucción técnica indica que no se produjeron modificaciones en los modelos, datasets, Spaces o paquetes públicos ni cambios que llegaran a su cadena de suministro de software. OpenAI, por su parte, indicó que puso en cuarentena los pesos del modelo de investigación implicado, reforzó los controles de sus infraestructuras y entornos de evaluación, restringió el acceso a Internet y al modelo y mejoró las medidas de monitorización y alineamiento. En su actualización del 26 de agosto, OpenAI señaló que había realizado una investigación exhaustiva junto con asesores externos y que estaba aplicando requisitos de seguridad y aislamiento más estrictos; además, afirmó que el incidente no afectó a los datos de clientes, ni a la funcionalidad o disponibilidad de sus productos.
-
27/07/2026Hugging Face


