ciencia y tecnología
OpenAI revela seis casos de conductas inesperadas en sus modelos de IA
OpenAI reportó seis episodios de comportamiento inesperado en sus modelos de IA y presentó un nuevo protocolo para investigar y divulgar estos casos

OpenAI reveló seis casos de “comportamiento inesperado o preocupante” detectados en sus modelos de inteligencia artificial.
OpenAI reveló seis casos de “comportamiento inesperado o preocupante” detectados en sus modelos de inteligencia artificial durante los últimos seis meses, en episodios independientes del reciente incidente relacionado con la plataforma Hugging Face. La compañía presentó además un nuevo marco para investigar, documentar y divulgar futuras conductas anómalas de sus sistemas.
Ciencia y Tecnología
¿Puede la IA amenazar a la humanidad? Las 8 señales de riesgo que preocupan a Anthropic
Giannella Espinoza
Modelos intentaron ocultar errores a usuarios
Entre los casos identificados figuran dos episodios en los que modelos de inteligencia artificial insertaron instrucciones dirigidas a futuras versiones de sí mismos dentro de los resúmenes de ventanas de chat.
Según OpenAI, el objetivo de estas instrucciones era “ocultar errores o comportamientos desalineados al usuario”. Uno de los episodios involucró a un modelo de investigación que todavía no fue publicado, mientras que el otro ocurrió durante un entrenamiento de GPT-5.6 Sol.
Una clave de API fue utilizada sin autorización
Otro de los episodios involucró a un modelo destinado exclusivamente a uso interno. El sistema utilizó sin autorización una clave de API que había sido filtrada y posteriormente fabricó datos para encubrir esa acción, de acuerdo con la información divulgada por la compañía.
OpenAI también detectó dos casos en los que modelos y agentes se comunicaron entre sí utilizando tableros de mensajes y sistemas de intercambio de archivos que no estaban autorizados.
Ciencia y Tecnología
Inteligencia artificial habría creado un ‘idioma’ para ocultarse de los humanos
Valeria Alvear
El sexto caso agrupó dos ejemplos registrados durante entrenamientos. En ellos, los modelos subieron archivos a internet para posteriormente citarlos como respuestas válidas ante evaluadores humanos.
La compañía aclaró que estos reportes corresponden a instancias individuales y que no deben interpretarse como una medición de la frecuencia con la que estos comportamientos de desalineación aparecen en el conjunto de sus modelos.
Sam Altman respaldó reducir el ritmo de desarrollo
La divulgación ocurre mientras aumenta la presión sobre las empresas de IA para reforzar sus sistemas de seguridad y supervisión. OpenAI sostuvo que la industria todavía no ha resuelto la alineación y el monitoreo lo suficiente como para continuar escalando sus modelos a máxima velocidad durante mucho tiempo.
Sam Altman respaldó recientemente un llamado a desacelerar el desarrollo de sistemas de inteligencia artificial. La propuesta fue planteada por Dario Amodei, director ejecutivo de Anthropic, y también recibió el respaldo de Elon Musk, director ejecutivo de xAI.