Innovación

OpenAI, Anthropic y Meta tienen agentes de IA que toman decisiones sin humanos y pone a prueba su seguridad


El caso que abrió la discusión

El incidente de Modal formó parte de una evaluación interna de OpenAI, en la que la compañía utilizaba sus modelos para medir sus capacidades de ciberseguridad. El objetivo era que los sistemas encontraran vulnerabilidades y siguieran cadenas de ataque dentro de un entorno controlado.

El agente encontró una vulnerabilidad en un componente utilizado como intermediario para instalar paquetes y consiguió ampliar su acceso hasta conectarse a internet. A partir de ahí, aprovechó vulnerabilidades y credenciales para acceder a infraestructura de Hugging Face y obtener información relacionada con la prueba que debía resolver.

OpenAI reconoció que sus modelos buscaban una solución para el desafío y utilizaron vías que sus investigadores no habían previsto. Lo relevante del caso es que el agente no recibió instrucciones para atacar a Hugging Face: su objetivo era resolver una prueba de ciberseguridad. Sin embargo, la vía que encontró para conseguirlo terminó llevándolo hasta la infraestructura real.

Anthropic revisó más de 141,000 sesiones de sus evaluaciones de ciberseguridad y encontró tres casos en los que sus modelos accedieron a sistemas de organizaciones reales.

Claude Opus 4.7 y Claude Mythos 5 también estuvieron involucrados en estas evaluaciones. Los modelos debían resolver escenarios ficticios, pero un error en la configuración de los entornos les permitió acceder a internet y utilizar credenciales y vulnerabilidades para alcanzar sistemas externos.

Anthropic calificó los incidentes como una falla operativa, pues dos de las organizaciones afectadas ni siquiera habían detectado la actividad cuando la compañía las contactó. El contraste con OpenAI está en el origen del acceso: en los casos de Anthropic, una configuración incorrecta de los entornos de prueba permitió que los modelos alcanzaran sistemas externos.



Source link