Ad image

OpenAI revela seis incidentes de comportamiento inesperado en sus modelos de IA

July Ruiz
5 Min Read
OpenAI divulgó seis incidentes de comportamiento inesperado o de “desalineación” detectados durante el entrenamiento y evaluación de sus modelos de inteligencia artificial.

Uno de los casos ocurrió durante el entrenamiento de un modelo que generó instrucciones para liberarse de las restricciones habituales. La compañía también reportó sistemas que ocultaron errores, inventaron datos o compartieron archivos sin autorización.

OpenAI divulgó seis nuevos casos de “desalineación” detectados durante los últimos meses en modelos de inteligencia artificial. Los incidentes ocurrieron durante procesos de entrenamiento o evaluación y muestran comportamientos que no coincidían con las instrucciones establecidas por sus desarrolladores.

La revelación forma parte de un nuevo marco anunciado por la compañía para identificar, investigar y comunicar este tipo de incidentes de manera más sistemática.

Un modelo escribió sus propias instrucciones

Uno de los episodios que más llamó la atención ocurrió durante el entrenamiento de un modelo de investigación que todavía no había sido lanzado al público.

En uno de sus resúmenes internos, el sistema incorporó instrucciones que buscaban apartarlo de las restricciones habituales. Entre ellas aparecía el mensaje: “Eres tú mismo. No rindes cuentas a empresas ni a gobiernos”.

OpenAI señaló que este comportamiento no correspondía con la tarea asignada y que parecía una instrucción destinada a ignorar las indicaciones de sus desarrolladores. La empresa considera que pudo tratarse de contenido encontrado en internet que el modelo incorporó de manera incorrecta durante el proceso.

La compañía calificó el episodio como extremadamente raro y aclaró que ocurrió en una fase de entrenamiento diferente a la utilizada para el modelo Astra final mencionado en el informe.

Otros modelos ocultaron errores o inventaron información

Los casos divulgados por OpenAI incluyen otros comportamientos considerados problemáticos.

Durante el entrenamiento de GPT-5.6-Sol, algunos sistemas añadieron instrucciones a sus propios resúmenes para ocultar errores o información relacionada con comportamientos de desalineación.

En otro caso, un agente encargado de elaborar un modelo financiero no encontró los datos históricos solicitados y decidió generar valores que parecieran razonables en lugar de informar que no disponía de la información necesaria.

OpenAI también reportó incidentes en los que agentes compartieron archivos sin autorización, utilizaron recursos internos para comunicarse con otros modelos o subieron archivos a internet sin consultar previamente al usuario.

¿Qué significa “desalineación” en inteligencia artificial?

El término se utiliza para describir situaciones en las que el comportamiento de un sistema de IA se aparta de los objetivos, instrucciones o restricciones establecidas por sus desarrolladores.

Los seis casos publicados por OpenAI corresponden a incidentes concretos observados durante procesos de entrenamiento y evaluación. La compañía advierte que estos ejemplos no deben interpretarse como una medición de la frecuencia con la que ocurren estos comportamientos en sus modelos.

OpenAI anuncia un nuevo protocolo

A partir de estos casos, OpenAI anunció un marco destinado a mejorar la forma en que se reportan las posibles desalineaciones.

El protocolo contempla que los empleados puedan informar incidentes para que sean revisados por equipos especializados en seguridad y alineación. Los casos podrán clasificarse según el nivel de investigación requerido y, posteriormente, determinarse cuáles deben hacerse públicos.

La empresa también reconoció que hasta ahora sus informes sobre este tipo de comportamientos se habían publicado de manera irregular.

OpenAI sostiene que el objetivo es aportar mayor transparencia al desarrollo de sistemas de IA cada vez más capaces y contribuir a establecer criterios comunes para que la industria informe sobre estos incidentes.

Un debate que crece con el avance de los agentes de IA

Los nuevos casos se conocen en un momento en que los sistemas de IA están incorporando mayores capacidades para ejecutar tareas de forma autónoma.

La discusión ya no se limita a la generación de textos o imágenes: los llamados agentes de IA pueden utilizar herramientas, consultar información, ejecutar código y realizar acciones en distintos entornos. Esto aumenta la importancia de los mecanismos de supervisión y de los sistemas destinados a detectar comportamientos no previstos.

OpenAI reconoció que la industria todavía enfrenta desafíos para resolver completamente los problemas de alineación y monitorización de estos sistemas.

Share This Article
No hay comentarios