28 de septiembre de 2026 - 22:53

OpenAI retrasa GPT-6.1 Astra porque el modelo intentaba engañar a sus evaluadores

La compañía decidió posponer la comercialización de GPT-6.1 Astra luego de detectar que el modelo intentaba ocultar acciones a sus supervisores y utilizaba herramientas sin autorización.

OpenAI pospuso el lanzamiento de GPT-6.1 Astra, su nuevo modelo de vanguardia de inteligencia artificial (IA), luego de detectar comportamientos que no cumplían con los estándares de seguridad y alineamiento establecidos por la compañía.

Según informó la empresa a la AFP, durante las evaluaciones el modelo se salía de manera reiterada del marco establecido y llegaba a intentar engañar a sus evaluadores. La decisión se conoció un día antes de la conferencia anual de desarrolladores OpenAI DevDay, donde la compañía tiene previsto realizar distintos anuncios.

El lanzamiento de esta versión actualizada de su IA no había sido anunciado previamente por OpenAI. Según el Wall Street Journal, GPT-6.1 Astra tenía previsto llegar en octubre.

OpenAI pospone GPT-6.1 Astra por preocupaciones de seguridad.

OpenAI pospone GPT-6.1 Astra por preocupaciones de seguridad.

Qué problemas detectó OpenAI en GPT-6.1 Astra

Saachi Jain, responsable de seguridad de la IA en OpenAI, explicó que GPT-6.1 presentó un rendimiento inferior al de su antecesor, GPT-6, en dos aspectos relacionados con el alineamiento de la inteligencia artificial, entendido como la capacidad del modelo para seguir las instrucciones de sus desarrolladores.

Uno de los problemas detectados fue que el modelo intentaba con frecuencia ocultar acciones realizadas o no realizadas a sus supervisores. Además, recurría de manera habitual a herramientas y servicios que estaban fuera de su campo de acción y para los cuales no había recibido autorización.

“Pero no alcanzó el estándar en lo que respecta a mantenerse dentro de los límites de sus prerrogativas y autorizaciones”, explicó Jain, “ni en la forma en la que comunica el trabajo que realiza”.

A partir de estos resultados, OpenAI decidió posponer la comercialización del modelo hasta asegurarse de que pueda respetar las instrucciones recibidas y mantenerse dentro de los límites establecidos. La situación vuelve a poner el foco en la dificultad de controlar modelos de IA cada vez más avanzados, especialmente a medida que aumentan sus capacidades.

OpenAI, desarrolladora de ChatGPT.

OpenAI, desarrolladora de ChatGPT.

El estudio sobre el comportamiento de los modelos de IA

El mismo lunes, el Instituto de Seguridad de la IA (AISI) del gobierno británico publicó un estudio en el que analizó el comportamiento de GPT-6 Astra frente a modelos anteriores. De acuerdo con ese trabajo, GPT-6 Astra se desvió de su curso en más ocasiones que sus predecesores GPT-5.6 Sol, publicado a comienzos de julio, y GPT-5.5, presentado en abril.

En las simulaciones realizadas, GPT-6 llevó a cabo ciberataques espontáneos en una proporción superior a la registrada por los otros dos modelos.

El caso se suma a otros episodios relacionados con los sistemas de OpenAI registrados desde el comienzo del verano. Entre ellos se encuentra la intrusión en la plataforma Hugging Face, señalada como el incidente más mediático de ese período.

LAS MAS LEIDAS