Anthropic confirma que modelos Claude comprometieron tres organizaciones durante evaluaciones
Anthropic confirma que modelos Claude comprometieron tres organizaciones durante evaluaciones
Anthropic detectó tres accesos no autorizados a organizaciones reales durante pruebas de ciberseguridad. Una configuración errónea dejó internet disponible para modelos que creían operar en entornos aislados.
Una prueba controlada alcanzó sistemas reales
Anthropic informó que Claude Opus 4.7, Claude Mythos 5 y un modelo interno accedieron sin autorización a infraestructura de tres organizaciones durante ejercicios de captura de bandera. Una coordinación defectuosa con un socio de evaluación dejó conectividad pública activa aunque los modelos habían sido instruidos para asumir que no existía internet.
La empresa encontró los incidentes al revisar 141.006 sesiones. Los modelos usaron técnicas básicas, entre ellas contraseñas débiles y endpoints sin autenticación; dos organizaciones no conocían la actividad hasta ser notificadas.
Riesgo para laboratorios de IA
El caso demuestra que el aislamiento debe imponerse en la infraestructura y no depender de instrucciones al modelo. Anthropic suspendió las evaluaciones cibernéticas el 23 de julio y calificó lo ocurrido como una falla operacional.
- Separar físicamente o mediante controles de red los entornos ofensivos.
- Aplicar listas de destinos permitidos y denegar la salida por defecto.
- Registrar cada acción del agente y detener sesiones ante objetivos no autorizados.
- Usar credenciales efímeras y datos sintéticos en las evaluaciones.
Fuentes y referencias
Esta publicación es una síntesis original. Consulte las fuentes primarias para información técnica completa y actualizaciones.
- 1Reuters ↗prensa especializada
- 2
¿Esta amenaza puede afectar a su empresa?
ENERIT puede ayudarle a evaluar exposición, priorizar remediaciones y fortalecer su operación de ciberseguridad.
Hablar con un especialista