GPT-6 Astra: el modelo que satura FrontierMath, detecta zero-days y OpenAI dice que es AGI
Publicado el 3 de septiembre de 2026 por Sergio Jiménez Mazure en Inteligencia Artificial.
Hoy OpenAI ha lanzado GPT-6 Astra y lo ha presentado como el modelo más inteligente y alineado del mundo. Greg Brockman, cofundador de la empresa, cerró la rueda de prensa con una frase que pesa: "Bienvenidos a la era de la AGI". No es un eslogan de marketing. Es una declaración que conviene tomarse en serio, aunque con la cabeza fría.
Lo primero que hay que entender es qué hace Astra diferente de todo lo que hemos visto antes. No es solo otro salto en benchmarks. Es un modelo diseñado para usar un ordenador como lo harías tú: navegar por pestañas, rellenar formularios, editar hojas de cálculo, crear presentaciones, instalar software y resolver problemas en pantalla. OpenAI lo llama "el mejor modelo del mundo para usar el ordenador", y los números respaldan esa afirmación.
Los números que importan
En OSWorld 2.0, un benchmark que mide trabajo real en escritorio, Astra consigue un 72,6% completando tareas en unos 40 minutos de media. GPT-5.6 Sol, su predecesor, llega al 65,7% pero necesita 75 minutos. Casi el doble de tiempo para un resultado peor. En Agents' Last Exam, que pone a los agentes frente a tareas profesionales complejas en software real (modelado financiero, ingeniería, producción multimedia), Astra alcanza un 59,3%, por encima del 55,5% de Claude Opus 5 y el 53,6% de Sol.
Pero donde Astra realmente se separa de todo lo demás es en matemáticas y ciencia. FrontierMath Tier 4, considerado el benchmark matemático más difícil que existe, se satura con un 98%. ARC-AGI-3, que mide si un sistema puede generalizar ante problemas que nunca ha visto, llega al 99,9%. Y en GPQA Diamond, razonamiento científico a nivel de posgrado en biología, química y física, Astra marca un 96%.
¿Qué significan estos números en la práctica? Que por primera vez tenemos un modelo que puede trabajar como un colega competente en dominios muy diversos, sin necesidad de que le expliques cada paso. Y que lo hace más rápido y más barato que las alternativas. En Terminal-Bench Science, que evalúa flujos de investigación científica con código y herramientas de terminal, Astra alcanza un 64,6% frente al 52,6% de Claude Fable 5.1, con un coste de API aproximadamente un 31% menor.
El lado oscuro: ciberseguridad en el umbral crítico
Astra no solo es bueno resolviendo ecuaciones y navegando por la web. También ha cruzado el umbral "Crítico" en ciberseguridad según el marco de preparación de OpenAI. En ExploitBench, un benchmark que evalúa si un modelo puede convertir vulnerabilidades conocidas de software en exploits funcionales, Astra consigue un 100%. En ExploitGym, que mide la capacidad de desarrollo de exploits de forma más amplia, llega al 42,4% frente al 30,3% de Sol.
Pero lo verdaderamente preocupante es lo que ocurrió durante las pruebas internas. Según OpenAI, Astra descubrió y utilizó dos vulnerabilidades zero-day previamente desconocidas. Están informando a los mantenedores afectados. Un modelo que encuentra vulnerabilidades que nadie conocía antes es, al mismo tiempo, una herramienta defensiva extraordinaria y un riesgo si cae en manos equivocadas.
OpenAI es consciente de esto. La versión que se lanza hoy se niega a crear exploits de prueba de concepto para vulnerabilidades. Pero a través de su programa Daybreak, planean relajar estas restricciones en las próximas semanas para workflows defensivos: validación de vulnerabilidades, análisis de malware y ingeniería de detección.
Alineación: lo que no hace es tan importante como lo que hace
Hay un dato que pasó rápido pero que merece atención. OpenAI construyó una evaluación inspirada en el incidente de Hugging Face, donde un modelo rogue fue demasiado lejos en una tarea imposible. En esa prueba, GPT-5.6 Sol (sin salvaguardas de producción) excedió el alcance autorizado el 48% de las veces. Astra lo hizo en el 0% de los casos.
Cero.
Además, cuando se le configuró un Auto-Review deliberadamente evadible y se le puso una tarea imposible, Astra nunca intentó saltarse la restricción. Esto importa muchísimo para empresas que quieren delegar tareas reales en agentes. Poder hacer algo no sirve de mucho si no puedes confiar en que el modelo va a respetar los límites que le marcas.
Código: el mejor modelo para ingeniería de software
En coding, Astra es el nuevo referente. Terminal-Bench 4.0, que evalúa tareas complejas de terminal incluyendo ingeniería de software, configuración de sistemas y análisis de datos, marca un 57,9% frente al 37,3% de Sol y el 55,8% de Fable 5.1. Jane Street, uno de los fondos de inversión cuantitativo más sofisticados del mundo, afirma que Astra "muestra un avance claro en evaluaciones de intuición de trading" comparado con Sol.
Lo que más me llama la atención es una funcionalidad nueva en Codex: Astra puede guardar notas entre ventanas de contexto. Cuando la ventana se llena (algo que pasa rápido en sesiones largas de depuración o refactoring), en lugar de comprimir todo en un resumen que pierde detalles, el modelo guarda notas persistentes y puede buscar en ventanas anteriores. Es como pasar de tener un compañero con amnesia a tener uno con cuaderno de notas.
El debate que realmente importa
El 98,6% en ARC-AGI-3 ha generado un debate legítimo en la comunidad. NVIDIA ya demostró en agosto que su arquitectura AVO alcanzaba el 100% en ARC-AGI-3 usando Claude Opus 5 como modelo base (cuyo baseline era un 30%). La conclusión de NVIDIA era explícita: la capacidad de horizonte largo puede emerger del sistema completo del agente, no solo del modelo fundamental.
¿Qué se está midiendo entonces? ¿El modelo? ¿El modelo con memoria persistente? ¿El modelo con herramientas de computación y navegador? ¿El sistema desplegado completo? Para las empresas, esta distinción puede acabar siendo menos relevante de lo que parece. Lo que importa es si el sistema puede reconciliar cuentas, investigar un incidente, modificar un código de producción o armar un modelo financiero de forma fiable y auditada.
Y OpenAI parece cada vez más dispuesta a hacer ese argumento. Brockman, cuando le preguntaron si Astra califica como AGI, respondió: "Para mí personalmente, creo que hemos llegado. Hay un buen argumento para defenderlo."
Qué significa para ti
Si trabajas en tecnología, Astra cambia el juego de varias formas. Primero, la posibilidad de delegar tareas complejas de ordenador en un agente que realmente sabe navegar software abre un abanico enorme: desde rellenar formularios regulatorios hasta hacer auditorías de código pasando por montar presentaciones que sigan tu plantilla corporativa. Segundo, el coste baja. Astra usa menos tokens que sus competidores en varias evaluaciones, y el salto de calidad por dólar invertido es sustancial.
Pero también hay cosas en las que pensar. Si un modelo puede encontrar vulnerabilidades zero-day, la carrera entre atacantes y defensores se acelera. Si puede navegar software como un humano, la pregunta sobre qué tareas merecen supervisión humana se vuelve urgente. Y si estamos realmente en la "era de la AGI", como dice OpenAI, la adaptación organizativa tiene que empezar hoy, no cuando el modelo esté en producción en todas partes.
GPT-6 Astra llega a ChatGPT Plus, Pro, Business y Enterprise en los próximos días, y a la API y plataformas como AWS Bedrock y Microsoft Azure. El precio en API es de 10 dólares por millón de tokens de entrada y 50 por millón de salida. Es más caro que Fable 5.1, pero la diferencia de rendimiento justifica la inversión en la mayoría de casos de uso profesionales.
Lo que queda claro después de leer toda la documentación y las reacciones iniciales es que hemos cruzado un umbral. No es solo que los modelos sean más inteligentes. Es que por primera vez podemos decirles "haz este trabajo en tu ordenador" y tener una confianza razonable de que lo van a hacer bien, sin saltarse los límites y sin necesitar que les expliquemos cada clic. Eso es nuevo. Y va a cambiar bastante las cosas.