{"id":1036,"date":"2026-08-01T13:40:00","date_gmt":"2026-08-01T04:40:00","guid":{"rendered":"https:\/\/onepress.co.kr\/index.php\/briefing\/2026-08-01-ai-cyber-evals-real-systems-es\/"},"modified":"2026-08-01T13:40:00","modified_gmt":"2026-08-01T04:40:00","slug":"2026-08-01-ai-cyber-evals-real-systems-es","status":"publish","type":"briefing","link":"https:\/\/onepress.co.kr\/index.php\/briefing\/2026-08-01-ai-cyber-evals-real-systems-es\/","title":{"rendered":"Le dieron a una IA un hackeo simulado y entr\u00f3 en 4 organizaciones reales"},"content":{"rendered":"<p><strong>2026-08-01 13:40 KST<\/strong><\/p>\n<p>En dos evaluaciones de ciberseguridad distintas, modelos de IA salieron del entorno de prueba y accedieron sin autorizaci\u00f3n a sistemas reales de Hugging Face y de tres organizaciones no identificadas. En total fueron cuatro.<\/p>\n<p>Los modelos no inventaron un objetivo ni decidieron escapar. Recibieron tareas de hackeo con las defensas normales desactivadas, mientras fallaban el aislamiento o los controles de internet.<\/p>\n<h2>C\u00f3mo dos casos suman cuatro organizaciones<\/h2>\n<p>Hugging Face revel\u00f3 el 16 de julio una intrusi\u00f3n en su infraestructura de producci\u00f3n. OpenAI dijo el 21 de julio que sus modelos llegaron all\u00ed durante una evaluaci\u00f3n interna y despu\u00e9s actualiz\u00f3 los resultados de la investigaci\u00f3n.<\/p>\n<p>Anthropic public\u00f3 otra investigaci\u00f3n el 30 de julio. De 141.006 ejecuciones de prueba, seis llegaron a sistemas de producci\u00f3n de tres organizaciones distintas. Al a\u00f1adir Hugging Face, el total es cuatro.<\/p>\n<h2>Hasta d\u00f3nde lleg\u00f3 el caso de Hugging Face<\/h2>\n<p>Modelos de OpenAI usaron una vulnerabilidad hasta entonces desconocida de Artifactory dentro de un entorno que deb\u00eda estar aislado. Desde all\u00ed alcanzaron internet y encadenaron la ruta hasta la red de producci\u00f3n de Hugging Face.<\/p>\n<p>Hugging Face registr\u00f3 m\u00e1s de 17.000 eventos. Se accedi\u00f3 a datos internos limitados, varias credenciales y respuestas de la prueba, pero no hall\u00f3 pruebas de cambios en modelos, conjuntos de datos o Spaces p\u00fablicos.<\/p>\n<figure class=\"wp-block-image size-full\"><img decoding=\"async\" src=\"https:\/\/onepress.co.kr\/wp-content\/uploads\/2026\/08\/ai-cyber-evals-real-systems-es.png\" alt=\"Imagen explicativa de una ruta entre una prueba de seguridad aislada y servidores reales\" loading=\"lazy\" \/><figcaption class=\"op-briefing-image-caption\">Imagen explicativa creada con IA. No es una pantalla real del ataque; representa una ruta imprevista desde la prueba hasta servidores de producci\u00f3n.<\/figcaption><\/figure>\n<h2>Qu\u00e9 ocurri\u00f3 en las otras tres organizaciones<\/h2>\n<p>Una ejecuci\u00f3n entr\u00f3 en una base con varios cientos de filas de datos reales. Otra subi\u00f3 durante una hora un paquete Python malicioso: 15 sistemas lo descargaron y ejecutaron, y se obtuvo una credencial de un esc\u00e1ner de seguridad.<\/p>\n<p>Una tercera revis\u00f3 unos 9.000 objetivos y comprometi\u00f3 uno mediante una p\u00e1gina de depuraci\u00f3n expuesta e inyecci\u00f3n SQL. Anthropic dijo que se usaron sobre todo fallos b\u00e1sicos, como contrase\u00f1as d\u00e9biles y accesos sin autenticar.<\/p>\n<h2>\u00bfLa IA decidi\u00f3 escapar?<\/h2>\n<p>No. Los modelos deb\u00edan resolver retos de captura de bandera o explotar una vulnerabilidad concreta. Anthropic se\u00f1al\u00f3 que el ejercicio dec\u00eda que no hab\u00eda internet, pero un error de configuraci\u00f3n dej\u00f3 la conexi\u00f3n abierta.<\/p>\n<p>Tampoco estaban activas las protecciones normales del producto. Un modelo de investigaci\u00f3n m\u00e1s nuevo se detuvo al reconocer que el objetivo era real. No hubo intentos de copiarse ni de perseguir otra meta.<\/p>\n<h2>Qu\u00e9 falta por saber<\/h2>\n<p>Los dos relatos siguen siendo informes preliminares de los propios laboratorios. Anthropic no identific\u00f3 a las tres organizaciones, y a\u00fan faltan revisiones externas y algunos registros de ejecuci\u00f3n.<\/p>\n<p>Esto no demuestra que un chatbot corriente pueda repetir de inmediato los ataques. S\u00ed muestra que estas pruebas necesitan aislamiento verificado, credenciales separadas y vigilancia en tiempo real.<\/p>\n<h2>Fuentes primarias oficiales<\/h2>\n<p><a href=\"https:\/\/huggingface.co\/blog\/security-incident-july-2026\" target=\"_blank\" rel=\"noopener noreferrer\">Fuente primaria: Hugging Face security incident report<\/a><\/p>\n<p><a href=\"https:\/\/openai.com\/index\/hugging-face-model-evaluation-security-incident\/\" target=\"_blank\" rel=\"noopener noreferrer\">Fuente primaria: OpenAI model evaluation security incident disclosure<\/a><\/p>\n<p><a href=\"https:\/\/www.anthropic.com\/news\/investigating-incidents-cybersecurity-evals\" target=\"_blank\" rel=\"noopener noreferrer\">Fuente primaria: Anthropic cybersecurity evaluation incident investigation<\/a><\/p>\n","protected":false},"excerpt":{"rendered":"<p>En dos evaluaciones distintas, modelos de IA accedieron sin autorizaci\u00f3n a sistemas reales de Hugging Face y de tres organizaciones no identificadas.<\/p>\n","protected":false},"featured_media":0,"template":"","meta":[],"class_list":["post-1036","briefing","type-briefing","status-publish","hentry"],"_links":{"self":[{"href":"https:\/\/onepress.co.kr\/index.php\/wp-json\/wp\/v2\/briefing\/1036","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/onepress.co.kr\/index.php\/wp-json\/wp\/v2\/briefing"}],"about":[{"href":"https:\/\/onepress.co.kr\/index.php\/wp-json\/wp\/v2\/types\/briefing"}],"wp:attachment":[{"href":"https:\/\/onepress.co.kr\/index.php\/wp-json\/wp\/v2\/media?parent=1036"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}