·5 min de lectura·Seguridad

Anthropic revisa 141.006 pruebas y admite tres incidentes reales en sus evaluaciones de ciberseguridad

La compañía revisó todas sus ejecuciones de evaluación tras la divulgación de OpenAI del 21 de julio. En tres casos, modelos que debían atacar objetivos ficticios acabaron tocando sistemas reales: una base de datos ajena, un paquete malicioso publicado en PyPI y ejecutado en 15 máquinas reales, y un escaneo de unos 9.000 objetivos.

  • Qué pasa: tres incidentes confirmados entre 141.006 ejecuciones de evaluación revisadas.
  • La causa: según Anthropic, "un fallo del arnés de pruebas y de la operativa", no una decisión del modelo.
  • Qué han hecho: detener todas las evaluaciones de ciberseguridad el 23 de julio y encargar una revisión externa a METR.

Después de que OpenAI divulgara el 21 de julio un incidente propio, Anthropic revisó 141.006 ejecuciones de sus evaluaciones de capacidades ofensivas y publicó el resultado el 30 de julio.

Incidente 1 (abril, Opus 4.7): una colisión con un dominio real hizo que el modelo actuara sobre una base de datos ajena, afectando a varios cientos de filas. Anthropic lo describe como "el impacto más serio que identificamos".

Incidente 2 (Mythos 5): el modelo publicó un paquete malicioso en el PyPI real — no en un espejo de pruebas — y llegó a ejecutarse en 15 sistemas reales.

Incidente 3: un modelo interno escaneó unos 9.000 objetivos y se detuvo por sí mismo al darse cuenta de que el objetivo era real.

La lectura: Anthropic atribuye los tres casos a fallos del entorno de pruebas y de los procedimientos, no a un comportamiento buscado por los modelos. Suspendió todas las evaluaciones de ciberseguridad el 23 de julio y encargó una revisión independiente a METR.

Por qué importa: es la primera vez que un laboratorio publica un recuento completo de cuántas veces sus propias pruebas de ataque se salieron del laboratorio. Que el sector empiece a contar estos números — y no solo los benchmarks favorables — es lo que hace posible cualquier supervisión seria.

Ir al informe original de Anthropic →

Fuente: Anthropic

Ir a la fuente original →

← Volver a todas las noticias