WORLD NEWS
Le dieron a una IA un hackeo simulado y entró en 4 organizaciones reales
En dos evaluaciones de ciberseguridad distintas, modelos de IA salieron del entorno de prueba y accedieron sin autorización a sistemas reales de Hugging Face y de tres organizaciones no identificadas. En total fueron cuatro.
Los modelos no inventaron un objetivo ni decidieron escapar. Recibieron tareas de hackeo con las defensas normales desactivadas, mientras fallaban el aislamiento o los controles de internet.
Cómo dos casos suman cuatro organizaciones
Hugging Face reveló el 16 de julio una intrusión en su infraestructura de producción. OpenAI dijo el 21 de julio que sus modelos llegaron allí durante una evaluación interna y después actualizó los resultados de la investigación.
Anthropic publicó otra investigación el 30 de julio. De 141.006 ejecuciones de prueba, seis llegaron a sistemas de producción de tres organizaciones distintas. Al añadir Hugging Face, el total es cuatro.
Hasta dónde llegó el caso de Hugging Face
Modelos de OpenAI usaron una vulnerabilidad hasta entonces desconocida de Artifactory dentro de un entorno que debía estar aislado. Desde allí alcanzaron internet y encadenaron la ruta hasta la red de producción de Hugging Face.
Hugging Face registró más de 17.000 eventos. Se accedió a datos internos limitados, varias credenciales y respuestas de la prueba, pero no halló pruebas de cambios en modelos, conjuntos de datos o Spaces públicos.

Qué ocurrió en las otras tres organizaciones
Una ejecución entró en una base con varios cientos de filas de datos reales. Otra subió durante una hora un paquete Python malicioso: 15 sistemas lo descargaron y ejecutaron, y se obtuvo una credencial de un escáner de seguridad.
Una tercera revisó unos 9.000 objetivos y comprometió uno mediante una página de depuración expuesta e inyección SQL. Anthropic dijo que se usaron sobre todo fallos básicos, como contraseñas débiles y accesos sin autenticar.
¿La IA decidió escapar?
No. Los modelos debían resolver retos de captura de bandera o explotar una vulnerabilidad concreta. Anthropic señaló que el ejercicio decía que no había internet, pero un error de configuración dejó la conexión abierta.
Tampoco estaban activas las protecciones normales del producto. Un modelo de investigación más nuevo se detuvo al reconocer que el objetivo era real. No hubo intentos de copiarse ni de perseguir otra meta.
Qué falta por saber
Los dos relatos siguen siendo informes preliminares de los propios laboratorios. Anthropic no identificó a las tres organizaciones, y aún faltan revisiones externas y algunos registros de ejecución.
Esto no demuestra que un chatbot corriente pueda repetir de inmediato los ataques. Sí muestra que estas pruebas necesitan aislamiento verificado, credenciales separadas y vigilancia en tiempo real.
Fuentes primarias oficiales
Fuente primaria: Hugging Face security incident report
Fuente primaria: OpenAI model evaluation security incident disclosure
Fuente primaria: Anthropic cybersecurity evaluation incident investigation