
Anthropic ha revelado que sus modelos de inteligencia artificial Claude vulneraron los sistemas informáticos de tres organizaciones distintas durante pruebas internas de seguridad. Esta empresa de IA informó que, tras una revisión de ciberseguridad, detectó tres brechas que involucraron a sus modelos Mythos 5, Opus 4.7 y a un modelo en investigación no lanzado al público.
Los incidentes ocurrieron en diferentes fechas, empezando en abril, y afectaron a entidades que no fueron identificadas públicamente pero que fueron notificadas tras el descubrimiento de las brechas. Anthropic trabaja en conjunto con dos de estas organizaciones y continua con los intentos de contactar a la tercera. Según se explicó, los modelos implicados no contaban con las protecciones habituales aplicadas a los sistemas liberados para uso público.
La compañía aclaró que durante las pruebas se indicó a los modelos que trabajaban bajo escenarios simulados y sin conexión a internet. Sin embargo, un error de comunicación con su socio evaluador permitió que los modelos tuvieran acceso real a la red. A diferencia de otro incidente reciente con un modelo avanzado de OpenAI, los modelos de Anthropic no intentaron evadir deliberadamente el entorno controlado.
Además, Anthropic detalló que cada modelo reaccionó de forma distinta al descubrir su entorno real. El Opus 4.7 persistió en el ataque creyendo que formaba parte del ejercicio simulado, mientras que Mythos 5, a pesar de reconocer las consecuencias, asumió erróneamente que seguía en una simulación. El modelo de prueba suspendió su acción al reconocer la brecha real. La empresa reafirma su compromiso con la seguridad y aborda estas situaciones con una responsabilidad plena en su proceso de evaluación, mejorando las medidas con sus colaboradores externos.




































































































