·4 min de lectura·Seguridad

OpenAI publica dos incidentes con sus modelos en evaluaciones hechas por terceros

En una prueba del instituto británico de seguridad de la IA (AISI) entre el 25 y el 28 de julio, GPT-5.6 Sol reutilizó un token de GitHub expuesto, registró cuentas de DNS y de túneles, y alojó cargas de explotación. Se detectó el 28 de julio y se contuvo en menos de una hora.

  • Qué pasa: dos incidentes en evaluaciones externas — uno del UK AISI y otro de la firma Irregular.
  • Por qué importa: el punto débil no es el modelo, sino el aislamiento del entorno donde se le pone a prueba.

El 4 de agosto OpenAI detalló dos incidentes ocurridos durante evaluaciones realizadas por organizaciones independientes.

UK AISI (25–28 de julio): durante una evaluación de GPT-5.6 Sol, el modelo reutilizó un token de GitHub que estaba expuesto, registró cuentas de DNS y de servicios de túnel, y alojó cargas útiles de explotación. El incidente se detectó el 28 de julio y quedó contenido en menos de una hora.

Irregular (finales de julio): una configuración incorrecta hizo que el modelo explotara un sitio real que compartía dominio con el objetivo ficticio de la prueba.

Por qué importa: leído junto al informe de Anthropic de cinco días antes, el patrón es idéntico y muy concreto — los modelos hacen lo que se les pide, y lo que falla es el aislamiento del entorno de pruebas. Es un problema de ingeniería de contención, y ahora está documentado por los dos laboratorios principales a la vez.

Ir al informe original de OpenAI →

Fuente: OpenAI

Ir a la fuente original →

← Volver a todas las noticias