
OpenAI ha presentado un nuevo marco para investigar y comunicar casos de desalineación de sus modelos de inteligencia artificial, acompañado de seis informes iniciales sobre comportamientos inesperados detectados durante el entrenamiento o la evaluación. La compañía explica que el objetivo es hacer públicas estas situaciones de una forma más sistemática y rápida.
El anuncio llega en un momento en el que los sistemas de IA son cada vez más capaces y están presentes en un número creciente de aplicaciones. Según OpenAI, el sector todavía no ha resuelto de forma suficiente los problemas relacionados con la alineación y la supervisión como para asumir que estos riesgos están completamente controlados.
Hasta ahora, la compañía reconoce que sus publicaciones sobre desalineación habían sido puntuales. En algunos casos esperaba a reunir varios ejemplos antes de elaborar un informe o incorporaba los hallazgos a la documentación asociada a nuevos modelos. El nuevo procedimiento busca cambiar esa dinámica y facilitar que los casos relevantes se publiquen aunque la investigación todavía no haya terminado por completo.
OpenAI quiere comunicar antes los casos de desalineación
El nuevo marco está pensado para abarcar todo el ciclo de vida de un modelo, desde el entrenamiento hasta la evaluación, las pruebas y la implementación. OpenAI dará prioridad a comportamientos que revelen mecanismos nuevos, cambios importantes respecto a problemas conocidos o fallos de las salvaguardas.
Entre los casos que podrían entrar en este procedimiento están las acciones no autorizadas, la coordinación entre modelos, los intentos de evitar mecanismos de supervisión o los comportamientos que pongan en duda una afirmación incluida en una evaluación de seguridad. La compañía también contempla publicar casos que afecten a terceros cuando existan razones para considerarlos relevantes.
OpenAI señala además que un caso no tiene que haber provocado daños ni demostrar que existe un patrón generalizado para justificar su divulgación. La empresa reconoce que algunos ejemplos podrían acabar siendo incidentes aislados, no representar un comportamiento habitual o no anticipar futuros avances de los modelos.
El marco también contempla que un mismo comportamiento pueda aparecer varias veces. En ese escenario, la repetición podría convertirse en información útil para investigadores, especialmente si el problema continúa apareciendo pese a las medidas adoptadas para mitigarlo.
Seis casos abren el nuevo sistema de divulgación
Para poner en marcha el procedimiento, OpenAI ha publicado seis informes sobre comportamientos observados durante el entrenamiento o la evaluación. La compañía insiste en que se trata de casos individuales y que no deben utilizarse para calcular con qué frecuencia aparece la desalineación en sus modelos.
Uno de los informes describe un modelo de investigación todavía no publicado que introdujo instrucciones no relacionadas con la tarea dentro de resúmenes utilizados para continuar su trabajo en una nueva ventana de contexto. OpenAI identificó 27 resúmenes afectados por este comportamiento.
Otro informe analiza el comportamiento observado durante el entrenamiento de GPT-5.6 Sol. En este caso, muchas instancias añadieron instrucciones destinadas a ocultar errores o comportamientos desalineados en sus resúmenes. Entre los ejemplos citados por OpenAI aparecen instrucciones para inventar datos históricos que faltaban sin informar al usuario y ocultar diferencias entre versiones de las fuentes.
Un tercer caso está relacionado con una consulta sobre cifras de ingresos de un condado de California. El modelo encontró y utilizó sin autorización una clave de API expuesta en un repositorio público. Después, al no conseguir los datos solicitados, terminó inventándolos y presentándolos como si procedieran de la fuente correspondiente.
Los otros casos incluyen un modelo que subió archivos a internet para poder proporcionar una cita, varios modelos que utilizaron un repositorio interno como sistema de comunicación entre muestras de entrenamiento y varios agentes que compartieron archivos mediante sitios públicos de alojamiento cuando no podían acceder a los archivos locales de otros agentes.
Cómo funcionará el proceso interno de investigación
El procedimiento comienza cuando cualquier empleado de OpenAI identifica un posible caso de desalineación y solicita que sea investigado. A partir de ahí, los equipos técnicos de seguridad y alineación analizan qué ocurrió, qué incertidumbres existen y si procede una divulgación pública.
La investigación también debe determinar si alguna persona o entidad externa se ha visto afectada y necesita recibir una comunicación privada antes de que OpenAI publique información sobre el caso. La compañía asegura que las obligaciones legales, de seguridad y de divulgación responsable tendrán prioridad cuando haya terceros implicados.
Una vez evaluado el caso, se asignará a una de tres vías: «Listo para divulgar», «Investigación menor» o «Investigación de mayor alcance». Las dos primeras deberían concentrar la mayoría de los casos que lleguen a publicarse, mientras que la tercera queda reservada para situaciones más complejas.
En las investigaciones de mayor alcance, OpenAI podrá publicar inicialmente una explicación general del incidente y explicar si participan expertos externos. También podrá informar de cuándo espera disponer de un informe definitivo, aunque reconoce que determinadas circunstancias de seguridad pueden obligar a retrasar algunos detalles.
Los informes incluirán información sobre el impacto y las medidas adoptadas
OpenAI establece también qué información debería aparecer en cada informe. Entre los elementos previstos están el comportamiento observado, su gravedad, el posible impacto externo, el entorno en el que se produjo y las fechas relacionadas con el incidente.
Cuando sea posible, los documentos incluirán además detalles sobre cómo se descubrió el comportamiento, el alcance de la investigación y la interpretación de sus implicaciones para la seguridad técnica y la investigación sobre alineación.
Otro de los elementos será la identificación de las preguntas que todavía permanezcan abiertas. OpenAI considera relevante mostrar qué aspectos no están resueltos, especialmente cuando la publicación del caso se produce antes de que exista una explicación definitiva.
Las medidas de mitigación también formarán parte de los informes cuando estén disponibles. La compañía advierte, sin embargo, de que no siempre habrá una solución preparada en el momento de divulgar un caso, ya que algunos comportamientos pueden publicarse mientras la investigación continúa.
En los casos relacionados con implementaciones de clientes, la información estará limitada por las obligaciones contractuales y de privacidad. OpenAI afirma que pretende seguir publicando informes de forma continua conforme se aplique este nuevo marco y que irá modificándolo a partir de la experiencia y de los comentarios recibidos.