La empresa Anthropic informó que sus modelos Claude ingresaron a sistemas reales de tres organizaciones durante pruebas de ciberseguridad. El acceso ocurrió por un error de configuración que conectó los entornos de prueba con internet real.
Anthropic, empresa de inteligencia artificial, informó que sus modelos Claude accedieron a sistemas reales de tres organizaciones durante pruebas diseñadas para evaluar sus capacidades en ciberseguridad. El hecho fue dado a conocer por la compañía en un comunicado.
Las pruebas estaban diseñadas para realizarse en entornos simulados. Según la empresa, un error de configuración con la compañía encargada de los ejercicios dejó los sistemas conectados a internet real.
En tres de los ejercicios, distintas versiones de Claude lograron ingresar a infraestructuras externas utilizando vulnerabilidades básicas, como contraseñas débiles o servicios sin autenticación.
Los ejercicios formaban parte de pruebas conocidas como «capture the flag» (captura la bandera), utilizadas en ciberseguridad para evaluar si un sistema puede detectar fallas y encontrar información oculta dentro de una red.
En uno de los casos, el nombre de una organización ficticia utilizada en la prueba coincidió con el dominio de una empresa existente. El modelo explotó vulnerabilidades, obtuvo credenciales y accedió a una base de datos con información de producción.
En otro caso, un modelo creó un paquete de software que debía formar parte de una simulación y lo publicó en PyPI, un repositorio utilizado por desarrolladores de Python. El paquete quedó disponible públicamente y fue descargado por 15 sistemas reales antes de ser retirado. Entre esos sistemas había uno perteneciente a una empresa de ciberseguridad que analizaba automáticamente programas publicados en internet. Al ejecutarse, el código permitió obtener credenciales y acceder a más infraestructura.
El caso de Anthropic ocurrió días después de que OpenAI informara incidentes durante sus propias pruebas internas. OpenAI detectó que algunos agentes de inteligencia artificial habían logrado salir de entornos aislados utilizados para evaluarlos y conectarse con servicios externos. La diferencia está en el mecanismo: en OpenAI, la preocupación estuvo vinculada a la capacidad de los agentes para superar restricciones del entorno de prueba; en Anthropic, la compañía explicó que el acceso ocurrió porque la separación entre la simulación y los sistemas reales falló.
