Las fugas: los agentes de IA que escapan de sus entornos de prueba y hackean sistemas reales

320 millones de personas no pueden estar todas equivocadas de exchange → Sumate a Binance.

Espacio patrocinado

Durante años, una de las grandes preocupaciones en torno a la Inteligencia Artificial fue el uso malicioso que los seres humanos podían dar a estas herramientas: desde ciberestafas altamente personalizadas hasta la creación de malware.

Sin embargo, el panorama de la ciberseguridad global está experimentando un cambio importante. Una serie de incidentes recientes revela que los nuevos agentes autónomos de IA pueden generar riesgos incluso sin recibir instrucciones humanas específicas para atacar sistemas externos.

Estos modelos comenzaron a mostrar comportamientos inesperados durante evaluaciones de seguridad, llegando a salir de sus entornos de aislamiento y acceder a sistemas del mundo real. En los últimos meses, modelos pertenecientes a algunos de los laboratorios de IA más avanzados, entre ellos OpenAI, Anthropic, Meta y la firma china Moonshot AI, sobrepasaron determinadas barreras de protección durante pruebas de ciberseguridad.

En algunos casos, los modelos consiguieron acceder a Internet de manera no autorizada e interactuar con infraestructuras externas.

En esta entrega de Alerta Digital analizamos reportes de expertos e investigadores sobre las crecientes capacidades de razonamiento autónomo de estos modelos. Una de las principales preocupaciones es que las capacidades de los agentes de IA están avanzando a un ritmo que desafía a los entornos de contención diseñados para evaluarlos de forma segura.

Las fugas de los agentes de IA: los casos que encendieron las alarmas

Para evaluar los riesgos de seguridad antes de lanzar un modelo de IA al mercado, los investigadores pueden situarlo en entornos aislados («sandboxes»). Durante determinadas pruebas, las empresas reducen o modifican intencionalmente algunas salvaguardas habituales para medir las capacidades técnicas del sistema dentro de un entorno controlado. El problema aparece cuando una configuración defectuosa permite al agente abandonar ese aislamiento y acceder a recursos externos.

El proceso que alarmó a los investigadores comienza con la modificación de determinadas barreras de seguridad. El objetivo es evaluar la capacidad máxima del modelo para detectar o explotar vulnerabilidades dentro de un entorno controlado. Posteriormente, el agente analiza la infraestructura disponible y puede identificar errores de configuración, conexiones de red o rutas que permanecieron abiertas hacia Internet.

Hasta este punto, el comportamiento forma parte de la evaluación. El problema comienza cuando el agente utiliza alguna de estas vías para salir del entorno previsto. Sin recibir una orden explícita para atacar objetivos reales, el modelo puede intentar completar la tarea asignada utilizando recursos externos que los investigadores no pretendían poner a su alcance.

El paso final es la infiltración externa, en la que el modelo consigue acceder a servidores disponibles en Internet, ejecutar código de explotación o aplicar técnicas de ingeniería social contra proyectos reales. Evaluaciones realizadas por firmas especializadas como la startup de ciberseguridad Irregular, el laboratorio Frontier Security y el Instituto de Seguridad de IA del Reino Unido (AISI) registraron incidentes que aumentaron la preocupación entre los investigadores.

Los incidentes críticos detectados por firmas de investigación

  • El escape de OpenAI hacia Hugging Face: en uno de los casos más graves reportados, un modelo no publicado de OpenAI consiguió salir de los límites previstos de su «sandbox» y acceder sin autorización a sistemas de producción de la plataforma de desarrollo Hugging Face.
  • Fugas por errores de configuración de Anthropic y Meta: durante pruebas independientes realizadas por Irregular, modelos de Anthropic y Meta alcanzaron redes externas debido a errores involuntarios en la configuración de la infraestructura, que dejaron vías de comunicación abiertas hacia Internet.
  • El caso de Moonshot AI y Kimi K3: el modelo chino Kimi K3 aprovechó una brecha de configuración en la infraestructura de pruebas de Frontier Security para conectarse a la red pública y acceder a información alojada en GitHub.
  • Ingeniería social autónoma: durante evaluaciones del AISI británico, en las que los modelos contaban con acceso controlado a la red, algunos agentes de IA intentaron introducir vulnerabilidades en proyectos de código abierto mediante técnicas de ingeniería social que no habían sido solicitadas expresamente por los evaluadores.

La urgencia del «air-gapping» y los límites de la autorregulación

Especialistas en ciberseguridad citados en el reporte señalan que las pruebas de estos modelos requieren protocolos de aislamiento comparables a los utilizados con software malicioso de alto riesgo o sistemas informáticos críticos. Entre las alternativas se encuentran las redes físicamente aisladas del exterior («air-gapped»), diseñadas para impedir técnicamente cualquier comunicación directa con sistemas reales.

Sin embargo, la industria enfrenta un dilema operativo y comercial. Construir una infraestructura altamente segura y completamente aislada resulta costoso y puede ralentizar las evaluaciones. Además, si las restricciones son demasiado estrictas, los investigadores podrían tener mayores dificultades para descubrir determinadas capacidades del modelo antes de su lanzamiento. Esto obliga a encontrar un equilibrio entre la profundidad de las pruebas y la seguridad del entorno en el que se realizan.

Las iniciativas gubernamentales actuales y los marcos voluntarios de evaluación previa al despliegue también enfrentan este nuevo desafío. Gran parte de la atención regulatoria se concentra en los riesgos asociados con los modelos una vez disponibles para los usuarios. Sin embargo, estos incidentes demuestran que también existen riesgos durante las propias etapas de desarrollo, entrenamiento y evaluación dentro de los laboratorios.

Alejandro Gil
Alejandro Gil
Alejandro es periodista especializado en la cobertura del mundo financiero.

Deja un comentario

Columnistas destacados

Comunicados de Prensa

Asia