Qué es el GPT-6 Astra y qué puede hacer
Astra fue descrito por OpenAI como "el modelo más inteligente y alineado que jamás hemos construido." El foco no es solo el razonamiento — es la ejecución autónoma. La compañía posiciona el modelo para operar computadoras de la misma forma que lo haría una persona: navegando interfaces, ejecutando código, realizando investigación científica y produciendo documentos profesionales sin intervención humana paso a paso. El eslogan de la campaña de lanzamiento resume el posicionamiento: "Cualquier cosa que puedas hacer en una computadora, Astra puede hacerlo por ti. Rápido." El modelo fue entrenado en el ciclo de cómputo más grande de la historia de OpenAI — más de 100.000 GPUs en el complejo Stargate, en Texas — y es el primero en el que modelos anteriores supervisaron activamente el entrenamiento del nuevo.
Benchmarks: avances reales y controversias declaradas
Los números publicados por OpenAI son agresivos. Astra alcanzó el 97,6% en FrontierMath Tier 4, un benchmark matemático de nivel avanzado; el 99,9% en ARC-AGI-3 usando el harness interno de OpenAI; y el 100% en ExploitBench, que mide la capacidad de convertir vulnerabilidades conocidas en exploits funcionales. En uso de computadora, el modelo marcó 72,6% en OSWorld 2.0, completando tareas en aproximadamente un 47% menos de tiempo que su predecesor GPT-5.6 Sol. Pero las controversias llegaron junto con los resultados. El ARC Prize — organización independiente que administra el ARC-AGI-3 — reportó un 62,7% usando su harness estándar, muy por debajo del 99,9% de OpenAI. La diferencia está en el método: OpenAI usó un "Provider Adapter" que preserva el estado de razonamiento entre llamadas, técnica no disponible en el harness estándar. El resultado es impresionante de cualquier forma — pero la comparación directa con otros modelos queda comprometida.
Ciberseguridad: el primer modelo "Critical" de OpenAI
Astra es el primer modelo de OpenAI en alcanzar el nivel "Critical" en su propio Preparedness Framework — la escala interna de evaluación de riesgo en ciberseguridad. En la práctica, esto significa que el modelo tiene capacidad de ejecutar tareas que podrían causar daños significativos en infraestructura digital. En ExploitBench con vulnerabilidades recientes — junio a agosto de 2026 — Astra marcó 39% frente al 5,5% del GPT-5.6 Sol. En SRE-Bench, que mide ingeniería inversa de binarios sin acceso al código fuente, el modelo resolvió el 88% de las tareas en el primer intento y el 99,2% en hasta cuatro intentos. Por eso, las capacidades más sensibles de ciberseguridad no están disponibles públicamente — quedan restringidas a organizaciones verificadas en el programa Daybreak Access. El modelo público rechaza tareas como la generación de exploits de prueba de concepto.
Rollout polémico y precio 2,5 veces mayor
El lanzamiento no estuvo exento de turbulencias. El acceso comenzó restringido a un grupo limitado de organizaciones en el programa Daybreak, dejando a los suscriptores de pago — incluidos los usuarios Pro — sin acceso el primer día. Sam Altman tuvo que disculparse públicamente y garantizó prioridad a los suscriptores Pro en la siguiente fase del rollout. El precio en la API es de 10 dólares por millón de tokens de entrada y 50 dólares por millón de tokens de salida — 2,5 veces el precio del GPT-5.6 Sol. La ventana de contexto es de 1.050.000 tokens, con un output máximo de 128.000 tokens. El modelo también está disponible a través de Amazon Bedrock y Microsoft Foundry. El corte de conocimiento es el 30 de abril de 2026.
Una semana de carrera en la cima
El lanzamiento del GPT-6 Astra ocurre dos días después del lanzamiento de Claude Fable 5.1 por parte de Anthropic, el 1 de septiembre de 2026. La semana concentró también anuncios de Meta y Google. Sam Altman describió el momento como "una nueva generación de emprendimiento." Brockman fue más lejos: afirmó creer personalmente que OpenAI alcanzó la AGI con este modelo, dejando la interpretación final a cargo de cada usuario. Astra compite directamente con el Claude Fable 5.1 de Anthropic en los benchmarks de uso de computadora y codificación — segmento donde los dos modelos ahora comparten la cima de la tabla.

