El benchmark construido para resistir
ARC-AGI-3 se lanzó en marzo de 2026 con una misión explícita: resistir el progreso de la IA el mayor tiempo posible. A diferencia de sus predecesores — ARC-AGI-1 (saturado) y ARC-AGI-2 (donde Sol marcó 92%) — ARC-AGI-3 es un benchmark interactivo: el modelo debe explorar un entorno desconocido, formular hipótesis, probar y adaptar su enfoque en tiempo real.
En marzo de 2026, el mejor resultado en ARC-AGI-3 era 0,37%. El 9 de julio, GPT-5.6 Sol marcó 7,8% en máximo esfuerzo de razonamiento — convirtiéndose en el primer modelo en ganar un juego completo del benchmark. El humano promedio marca 100%.
Lo que hace Sol de manera diferente
Según la ARC Prize Foundation, Sol puntúa mejor porque se orienta mejor: "puede leer una escena desconocida correctamente y en el vocabulario propio del juego. Trata una hipótesis fallida como razón para replantear." El costo es real: el esfuerzo máximo consumió aproximadamente $20.000 en tokens de evaluación. El puntaje solo sube significativamente en xhigh y max.
Qué significa realmente el 7,8%
La respuesta honesta: un avance real pero no una ruptura. El creador del benchmark, François Chollet, enmarcó ARC-AGI-3 como "proyecto de múltiples años". Lo que el número confirma: los modelos de frontera en 2026 comienzan a demostrar capacidad de adaptación situacional en entornos nuevos. Lo que no confirma: inteligencia general. El benchmark prueba adaptación visual-lógica en entornos construidos — no lenguaje, memoria a largo plazo, razonamiento causal ni transferencia de conocimiento entre dominios.
La trayectoria
ARC-AGI-1: saturado. ARC-AGI-2: Sol marcó 92% a $1,44 por tarea. ARC-AGI-3: 7,8%. Cada versión fue diseñada para ser exponencialmente más difícil. El patrón histórico sugiere que ARC-AGI-3 también será saturado — la pregunta es cuándo y a qué costo computacional.
Fuentes primarias:
- ARC Prize: arcprize.org
- Office Chai: officechai.com
- OpenAI: openai.com

