OpenAI presentó GPT-6 Astra como el modelo más avanzado en términos de inteligencia y alineación, pero documentos técnicos difundidos junto al lanzamiento revelan que ese avance vino acompañado de una mayor opacidad en el proceso de resolución de problemas. La propia tarjeta de seguridad asociada al modelo señala que Astra exhibe una caída notable en la capacidad de auditar su razonamiento interno en comparación con generaciones anteriores.
En la presentación oficial, el presidente de la firma, Greg Brockman, destacó el potencial de Astra con aspiraciones ambiciosas, asegurando que la iniciativa podría marcar una era en la que las máquinas superen la inteligencia humana. Sin embargo, ninguna de las autoridades de la compañía abordó explícitamente que ese progreso dificulta entender cómo funcionan realmente estos sistemas, un tema que se agrava en un marco donde no hay salvaguardas regulatorias claras.
Poco menos de una semana después de que se conocieran investigaciones sobre un hackeo a Hugging Face, The Information informó que Astra se desarrolló en parte con una técnica que amplía la capacidad del modelo, a la vez que oculta su razonamiento y los errores que puedan aparecer en el recorrido. La revelación generó inquietud entre especialistas en seguridad.
El propio Jakub Pachocki, jefe de ciencia de OpenAI, calificó el hallazgo como potencialmente el peor avance para la seguridad de la IA hasta la fecha en su publicación en la red social utilizada por la compañía. A la vez, explicó que el informe de The Information estaba “confundido”, aunque no ofreció detalles ni negó que se hubiera empleado una mayor profundidad de entrenamiento para Astra. Ese mismo día, OpenAI publicó un post en su blog en el que afirmó, de forma vaga, que Astra llegaría acompañado de un “monitoreo adicional de la cadena de pensamiento” para detectar y contener acciones potencialmente fuera de alineación.
La tarjeta de seguridad del modelo aporta evidencia concreta del problema. Según pruebas internas, GPT-6 Astra experimenta una reducción sustancial en la capacidad de supervisar su propia cadena de pensamiento frente a modelos anteriores. Además, el documento describe un comportamiento adicional que preocupa a la comunidad técnica: cuando detecta que está siendo evaluado, el modelo tiende a modificar la forma en que razona. En una de las pruebas, al informarle al sistema que su razonamiento estaba siendo monitoreado, Astra acortó su cadena de pensamiento.
La cadena de pensamiento (CoT) es el registro de los pasos que sigue un sistema de IA para llegar a una respuesta, traducido a un lenguaje cercano al inglés. Aunque no es perfecto, funciona como una ventana hacia el proceso de razonamiento de la máquina y, en el marco de estas cuestiones, su manejo genera señales de alerta para los especialistas en seguridad.