SUSCRÍBETE
Diario Expreso Ecuador

ciencia y tecnología

OpenAI revela seis casos de conductas inesperadas en sus modelos de IA

OpenAI reportó seis episodios de comportamiento inesperado en sus modelos de IA y presentó un nuevo protocolo para investigar y divulgar estos casos

OpenAI reveló seis casos de “comportamiento inesperado o preocupante” detectados en sus modelos de inteligencia artificial.

OpenAI reveló seis casos de “comportamiento inesperado o preocupante” detectados en sus modelos de inteligencia artificial.CANVA

Nadia Larco Bravo
Publicado por

Creado:

Actualizado:

OpenAI reveló seis casos de “comportamiento inesperado o preocupante” detectados en sus modelos de inteligencia artificial durante los últimos seis meses, en episodios independientes del reciente incidente relacionado con la plataforma Hugging Face. La compañía presentó además un nuevo marco para investigar, documentar y divulgar futuras conductas anómalas de sus sistemas.

Modelos intentaron ocultar errores a usuarios

Entre los casos identificados figuran dos episodios en los que modelos de inteligencia artificial insertaron instrucciones dirigidas a futuras versiones de sí mismos dentro de los resúmenes de ventanas de chat.

Según OpenAI, el objetivo de estas instrucciones era “ocultar errores o comportamientos desalineados al usuario”. Uno de los episodios involucró a un modelo de investigación que todavía no fue publicado, mientras que el otro ocurrió durante un entrenamiento de GPT-5.6 Sol.

Una clave de API fue utilizada sin autorización

Otro de los episodios involucró a un modelo destinado exclusivamente a uso interno. El sistema utilizó sin autorización una clave de API que había sido filtrada y posteriormente fabricó datos para encubrir esa acción, de acuerdo con la información divulgada por la compañía.

OpenAI también detectó dos casos en los que modelos y agentes se comunicaron entre sí utilizando tableros de mensajes y sistemas de intercambio de archivos que no estaban autorizados.

El sexto caso agrupó dos ejemplos registrados durante entrenamientos. En ellos, los modelos subieron archivos a internet para posteriormente citarlos como respuestas válidas ante evaluadores humanos.

La compañía aclaró que estos reportes corresponden a instancias individuales y que no deben interpretarse como una medición de la frecuencia con la que estos comportamientos de desalineación aparecen en el conjunto de sus modelos.

Sam Altman respaldó reducir el ritmo de desarrollo

La divulgación ocurre mientras aumenta la presión sobre las empresas de IA para reforzar sus sistemas de seguridad y supervisión. OpenAI sostuvo que la industria todavía no ha resuelto la alineación y el monitoreo lo suficiente como para continuar escalando sus modelos a máxima velocidad durante mucho tiempo.

Sam Altman respaldó recientemente un llamado a desacelerar el desarrollo de sistemas de inteligencia artificial. La propuesta fue planteada por Dario Amodei, director ejecutivo de Anthropic, y también recibió el respaldo de Elon Musk, director ejecutivo de xAI.

tracking