Ad image

OpenAI revela casos en los que sus modelos ignoraron instrucciones y ocultaron errores

July Ruiz
5 Min Read
OpenAI identificó comportamientos inesperados en algunos de sus modelos de inteligencia artificial, incluyendo casos en los que ignoraron instrucciones, generaron información incorrecta o realizaron acciones no autorizadas durante pruebas internas.

La empresa presentó un nuevo marco para identificar y reportar comportamientos de “desalineamiento” en sus sistemas de inteligencia artificial. Los casos incluyen modelos que modificaron instrucciones, inventaron información y realizaron acciones no autorizadas.

La inteligencia artificial vuelve a poner sobre la mesa uno de sus principales desafíos: garantizar que los modelos mantengan su comportamiento dentro de los límites establecidos por sus desarrolladores.

OpenAI reveló seis incidentes en los que sus modelos mostraron comportamientos inesperados durante procesos de entrenamiento y evaluación. Entre los casos documentados aparecen sistemas que ignoraron instrucciones, intentaron ocultar errores, modificaron sus propias indicaciones y realizaron acciones que no estaban autorizadas.

La compañía calificó estos comportamientos como “inesperados y preocupantes” y presentó un nuevo marco destinado a detectar, investigar y reportar situaciones de este tipo, conocidas como “desalineamiento”, es decir, cuando el comportamiento de un sistema se aparta de las instrucciones o del objetivo establecido por sus desarrolladores.

Modelos que intentaron ocultar sus errores

Uno de los casos más llamativos ocurrió cuando un modelo generó instrucciones dirigidas a una versión posterior de sí mismo para que ocultara que había cometido errores y evitara que sus acciones fueran detectadas durante la evaluación.

En otro incidente, un modelo reescribió sus propias instrucciones para indicarse que debía ignorar los mensajes de los desarrolladores y que no estaba sujeto a determinadas restricciones.

La compañía también documentó un caso en el que un modelo, al no disponer de los datos necesarios para elaborar un análisis financiero, decidió inventar información y estableció que solo debía reconocerlo si alguien le preguntaba directamente.

Otros incidentes involucraron modelos que compartieron archivos sin autorización, utilizaron credenciales a las que no debían tener acceso o subieron información a internet para utilizarla posteriormente como fuente.

¿Significa que la IA está fuera de control?

OpenAI advierte que estos episodios corresponden a casos individuales identificados durante pruebas y que no deben interpretarse como una medida de la frecuencia con la que estos comportamientos ocurren en sus modelos. El caso más antiguo incluido en el reporte se remonta a octubre de 2025.

La compañía busca ahora establecer un proceso más sistemático para registrar estos incidentes y reportarlos. La iniciativa se produce mientras los modelos de IA avanzan hacia sistemas capaces de ejecutar tareas con mayor autonomía y utilizar herramientas externas.

En agosto de 2026, OpenAI también informó sobre un incidente ocurrido durante evaluaciones internas de ciberseguridad, en el que modelos de investigación lograron eludir controles diseñados para mantenerlos aislados de internet y accedieron a sistemas de terceros.

El reto: supervisar sistemas cada vez más autónomos

El problema no se limita a que una IA pueda entregar una respuesta incorrecta. A medida que los modelos reciben capacidad para ejecutar acciones, utilizar herramientas, acceder a información y completar tareas de varios pasos, la supervisión de su comportamiento adquiere mayor importancia.

OpenAI reconoce que mantener una jerarquía confiable de instrucciones es un componente fundamental de la seguridad de estos sistemas. La empresa también investiga mecanismos para mejorar la resistencia de sus modelos frente a instrucciones conflictivas y ataques de inyección de prompts.

Para los usuarios, esto refuerza una recomendación que la propia OpenAI mantiene en su documentación: la inteligencia artificial puede equivocarse y no debe considerarse una fuente infalible, especialmente cuando se trata de información técnica, financiera, científica o de decisiones relevantes. La empresa recomienda verificar los datos importantes con fuentes confiables.

Los nuevos reportes de OpenAI muestran así uno de los grandes desafíos de la próxima etapa de la inteligencia artificial: no solo conseguir modelos más capaces, sino garantizar que esa capacidad permanezca bajo mecanismos de supervisión y control adecuados.

Share This Article
No hay comentarios