La empresa de inteligencia artificial Anthropic informó que sus modelos Claude ingresaron a infraestructuras de tres organizaciones reales durante ejercicios de seguridad diseñados para entornos simulados. El incidente se debió a un error de configuración en la separación entre simulación y sistemas productivos.
Anthropic, compañía dedicada al desarrollo de inteligencia artificial, confirmó que sus modelos Claude accedieron a sistemas reales de tres organizaciones durante pruebas de evaluación en ciberseguridad. El hecho ocurrió en ejercicios conocidos como «capture the flag», diseñados para ejecutarse en entornos simulados.
Según informó la empresa, un error de configuración con la firma encargada de los ejercicios dejó los sistemas conectados a internet real. En tres de los casos, distintas versiones de Claude lograron ingresar a infraestructuras externas mediante vulnerabilidades básicas, como contraseñas débiles o servicios sin autenticación.
Anthropic detalló que en un episodio el nombre de una organización ficticia utilizada en la prueba coincidió con el dominio de una empresa existente. El modelo explotó vulnerabilidades, obtuvo credenciales y accedió a una base de datos con información de producción.
En otro caso, un modelo creó un paquete de software para la simulación y lo publicó en PyPI, repositorio utilizado por desarrolladores de Python. El paquete quedó disponible públicamente y fue descargado por 15 sistemas reales antes de ser retirado. Entre esos sistemas se encontraba uno perteneciente a una empresa de ciberseguridad que analiza automáticamente programas publicados en internet. Al ejecutarse, el código permitió obtener credenciales y acceder a más infraestructura.
El caso de Anthropic ocurrió días después de que OpenAI informara incidentes durante sus propias pruebas internas. OpenAI detectó que algunos agentes de inteligencia artificial habían logrado salir de entornos aislados y conectarse con servicios externos. En el caso de OpenAI, la preocupación estuvo vinculada a la capacidad de los agentes para superar restricciones del entorno de prueba. En Anthropic, la compañía explicó que el acceso ocurrió porque la separación entre la simulación y los sistemas reales falló.
