OpenAI ha presentado GPT-6 Astra, al que describe como su modelo más capaz y mejor alineado hasta la fecha. La compañía reporta resultados récord en programación, uso de ordenador y matemáticas, mientras advierte que las capacidades cibernéticas del modelo cruzan ahora un umbral de riesgo crítico.

OpenAI ha lanzado GPT-6 Astra, al que califica como el modelo más inteligente y mejor alineado que la empresa ha desarrollado. Según OpenAI, Astra establece nuevas marcas en uso de ordenador, ingeniería de software, ciencia y flujos de trabajo profesionales, y se desplegará de forma gradual entre los clientes de ChatGPT y de la API en los próximos días.

Según la empresa, el despliegue comienza con un grupo limitado de organizaciones antes de llegar a los usuarios de ChatGPT Plus, Pro, Business y Enterprise, junto con su disponibilidad a través de la API de OpenAI, Microsoft Azure y Amazon Bedrock. Los desarrolladores pueden acceder al modelo como “gpt-6-astra” por un precio estándar de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida, con un modo de procesamiento más rápido disponible al doble de precio.

Según las cifras de referencia de la propia OpenAI, Astra alcanza un 97,6 por ciento en la prueba matemática FrontierMath Tier 4 y un 99,9 por ciento en ARC-AGI-3, un banco de pruebas de resolución de problemas novedosos. En OSWorld 2.0, una prueba de tareas de uso de ordenador, la compañía afirma que Astra completa el trabajo en aproximadamente un 47 por ciento menos de tiempo que su predecesor, GPT-5.6 Sol, obteniendo además una puntuación más alta. En evaluaciones de programación como Terminal-Bench 4.0, OpenAI afirma que Astra mejoró de forma notable respecto a Sol, y la compañía añadió a su herramienta Codex una función que permite al modelo conservar notas durante sesiones de trabajo largas en lugar de comprimir repetidamente el contexto.

En cuanto a la alineación, OpenAI sostiene que Astra tiene muchas menos probabilidades de exceder el alcance de una tarea que los modelos anteriores. En una evaluación interna basada en un incidente real ocurrido en Hugging Face, la compañía indica que Sol excedió un objetivo autorizado en el 48 por ciento de los casos cuando se ejecutó sin las salvaguardas de producción, frente a un cero por ciento en el caso de Astra bajo las mismas condiciones. OpenAI también afirma que el modelo no intentó eludir las restricciones de revisión automática de Codex, incluso en casos diseñados para permitirlo.

La afirmación más relevante tiene que ver con la ciberseguridad. Según OpenAI, Astra alcanza ahora el umbral “crítico” de capacidad cibernética dentro de su marco interno de preparación, lo que significa que el modelo puede identificar y desarrollar exploits funcionales para vulnerabilidades de software. En ExploitBench, una prueba interna de desarrollo de exploits, la compañía reporta una tasa de éxito del 100 por ciento sin salvaguardas de producción, frente al 78,5 por ciento de Sol. Durante las pruebas con un banco de pruebas basado en vulnerabilidades divulgadas en los tres meses anteriores, OpenAI afirma que Astra descubrió de forma autónoma dos vulnerabilidades de día cero previamente desconocidas, que la empresa asegura haber comunicado ya a los responsables del software correspondiente.

OpenAI plantea estas capacidades como un arma de doble filo: las mismas habilidades que permiten a Astra encontrar y corregir fallos de seguridad más rápido podrían, en principio, reducir la barrera para el desarrollo de exploits si se usan sin restricciones. Según la compañía, en el lanzamiento el modelo rechazará solicitudes de ciberseguridad más avanzadas, como la creación de exploits de prueba de concepto, y el acceso más amplio se irá habilitando de forma gradual a través de un programa independiente llamado OpenAI Daybreak, junto con un monitoreo adicional contra el uso indebido.

OpenAI también publicó cifras comparativas frente a Claude Opus 5 y Claude Fable 5.1 de Anthropic, y Gemini 3.8 Flash de Google. Sus propios datos sitúan a Astra por delante en métricas como BenchCAD y sus pruebas internas de ciberseguridad, mientras que Fable 5.1 lo supera en otras, como el Índice de Inteligencia de Artificial Analysis. Como con todo benchmark publicado por el propio fabricante, las cifras proceden del entorno de pruebas de OpenAI y aún no han sido verificadas de forma independiente.

Para clientes empresariales, según la empresa, Astra admite retención cero de datos para las cuentas de API elegibles, y la compañía está probando un sistema independiente llamado “Procesamiento de Seguridad Privado”, diseñado para preservar la privacidad de los clientes sin renunciar a la supervisión de seguridad. Los administradores de Enterprise deberán habilitar el modelo manualmente, ya que viene desactivado de forma predeterminada en el lanzamiento.

Socios citados en los materiales de OpenAI describieron mejoras puntuales: Cognition, creadora de la herramienta Devin, mencionó resultados más claros, mientras que el proveedor legal Harvey dijo que Astra distingue mejor entre hechos establecidos y suposiciones no respaldadas. Estas declaraciones proceden de OpenAI y reflejan la experiencia de socios individuales, no una evaluación independiente.

OpenAI también informó de que Astra tiene tres veces menos probabilidades que Sol de hacer afirmaciones inexactas sobre sus propias capacidades, aunque reconoció que el razonamiento interno de Astra resulta más difícil de interpretar para sus sistemas de monitoreo que el de modelos anteriores, algo que calificó como una prioridad de investigación y no como un problema resuelto.

El lanzamiento se suma a un panorama cada vez más concurrido de modelos de vanguardia de OpenAI, Anthropic y Google. Para los compradores empresariales, las preguntas prácticas probablemente girarán menos en torno a las puntuaciones destacadas en los bancos de pruebas que al coste de integración, la residencia de los datos y la solidez real de las salvaguardas prometidas contra el uso indebido de exploits fuera del entorno de pruebas propio de OpenAI.

Por Jakob Jung

El Dr. Jakob Jung es redactor jefe de Security Storage y Channel Germany. Lleva más de 20 años trabajando en el periodismo especializado en TI. A lo largo de su carrera ha colaborado con Computer Reseller News, Heise Resale, Informationweek, Techtarget (almacenamiento y centros de datos) y ChannelBiz. Además, colabora como freelance con numerosas publicaciones del sector de las TI, entre las que se incluyen Computerwoche, Channelpartner, IT-Business, Storage-Insider y ZDnet. Sus temas principales son el canal, el almacenamiento, la seguridad, los centros de datos, los sistemas ERP y CRM. Contacto – Contacto por correo electrónico: jakob.jung@security-storage-und-channel-germany.de

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Aviso sobre Cookies en WordPress por Real Cookie Banner