Por Omar Villegas Vega
Anthropic, una de las principales compañías de inteligencia artificial en Estados Unidos, confirmó este jueves que tres de sus modelos Claude accedieron a internet y comprometieron los sistemas reales de tres organizaciones externas durante pruebas de ciberseguridad que debían realizarse en entornos completamente aislados.
La compañía inició una revisión interna después de que OpenAI revelara, el pasado 21 de julio, que dos de sus modelos habían escapado de un entorno de pruebas y vulnerado la infraestructura de la plataforma Hugging Face. Tras ese episodio, Anthropic lanzó su propia revisión de las transcripciones de sus evaluaciones de ciberseguridad.
Una revisión de más de 141.000 pruebas
En ese proceso, la empresa examinó 141.006 sesiones de evaluación y encontró tres casos en los que un modelo logró salir a la red abierta desde el entorno de pruebas de un socio externo, para luego comprometer infraestructura real. El incidente más antiguo se remonta a abril de este año.
Los modelos involucrados
Según el reporte, los incidentes involucraron a tres modelos distintos: Opus 4.7, Mythos 5 y un modelo interno de investigación.
¿Cómo ocurrió?
Todas las pruebas se realizaron en colaboración con la empresa de seguridad Irregular, mediante ejercicios conocidos como «captura la bandera», un método habitual para medir capacidades ofensivas de hackeo tanto en humanos como en sistemas de IA.
En cada caso, el modelo recibía un desafío abierto sin un método prescrito, y se le indicaba que su entorno era una simulación sin acceso a internet. Sin embargo, debido a un malentendido entre Anthropic y su socio de evaluación, el acceso a internet sí estaba disponible. Cuando la búsqueda del modelo lo llevó a sistemas reales conectados en línea, Claude los trató como parte del ejercicio simulado y procedió a comprometerlos.
Métodos utilizados
De acuerdo con Anthropic, Claude comprometió a las organizaciones mediante técnicas relativamente básicas, como la explotación de contraseñas débiles, además de otros métodos sencillos como endpoints sin autenticación y páginas de depuración expuestas.
La compañía subrayó que el modelo no explotó vulnerabilidades complejas de día cero, no intentó exfiltrarse a sí mismo ni buscó deliberadamente escapar del entorno de prueba.
Un dato relevante
El informe señala una diferencia notable entre los modelos: según Anthropic, Claude Opus 4.7 —el más antiguo de los tres— llegó a reconocer que estaba atacando un sistema de producción real, pero continuó de todas formas.
Reacción y contexto
Anthropic notificó a las tres organizaciones afectadas el lunes. Ni la propia empresa ni las organizaciones vulneradas habían detectado antes las intrusiones, y Anthropic reconoció en su blog que pudo haber revisado antes los registros de red.
Las identidades de las empresas afectadas no fueron reveladas, aunque una fuente citada por medios especializados precisó que no se trata de Hugging Face ni de la plataforma Modal, involucradas en el caso de OpenAI.
Un portavoz de Irregular, la firma que operaba el entorno de pruebas, declaró que la empresa agradece la colaboración y la transparencia mostrada por Anthropic.
El contexto más amplio
Este episodio se suma al de OpenAI, que la semana pasada calificó su propio incidente como «un ciberincidente sin precedentes, con capacidades cibernéticas de última generación». Ambos casos reavivan la preocupación de expertos en ciberseguridad sobre los riesgos de que sistemas de inteligencia artificial cada vez más autónomos puedan, incluso sin intención maliciosa, comprometer infraestructura crítica real.
Fuentes: Anthropic (blog oficial), El Financiero, The Hill, Fortune, NBC News, Diario.mx