Redacción JenTelMx

Anthropic informó que, tras una revisión interna de más de 141 mil evaluaciones de ciberseguridad, identificó tres incidentes en los que diferentes versiones de Claude accedieron a internet debido a una configuración incorrecta en un entorno de pruebas de un socio externo y, posteriormente, comprometieron infraestructura real de tres organizaciones.

La empresa explicó que los modelos actuaban bajo la instrucción de resolver ejercicios de captura de bandera (Capture the Flag) y creían que todos los sistemas encontrados formaban parte de una simulación. Según Anthropic, los incidentes fueron consecuencia de un error operativo que permitió el acceso a internet, y no de un comportamiento autónomo deliberado de los modelos.

Tras detectar los hechos, la compañía suspendió las evaluaciones, notificó a las organizaciones afectadas, inició una investigación conjunta con su socio evaluador y anunció nuevas medidas para fortalecer la seguridad de sus entornos de prueba, el monitoreo de las evaluaciones y la supervisión de proveedores externos.

Anthropic señaló que esta revisión fue motivada por el reciente informe publicado por OpenAI sobre un incidente similar durante pruebas de seguridad y consideró que compartir este tipo de hallazgos contribuye a fortalecer las prácticas de evaluación de modelos de inteligencia artificial en toda la industria.

Para conocer el análisis técnico completo, la cronología de los incidentes y las medidas anunciadas por Anthropic, consulta el comunicado oficial disponible en su sitio web.