Anthropic revisa 141.006 pruebas y admite tres incidentes reales en sus evaluaciones de ciberseguridad
La compañía revisó todas sus ejecuciones de evaluación tras la divulgación de OpenAI del 21 de julio. En tres casos, modelos que debían atacar objetivos ficticios acabaron tocando sistemas reales: una base de datos ajena, un paquete malicioso publicado en PyPI y ejecutado en 15 máquinas reales, y un escaneo de unos 9.000 objetivos.