Qué ocurrió

La Olimpiada Internacional de Matemáticas de 2026 concluyó con un resultado que habría parecido impensable hace dos años: tres modelos de lenguaje de frontera alcanzaron una puntuación perfecta de 42/42 en los seis problemas de la competición más prestigiosa del mundo.

Deedy Das, socio de Menlo Ventures e inversor en Anthropic, sometió los problemas de la IMO 2026 a cuatro modelos de frontera. Los resultados: Claude Fable 5 logró el 42/42 en 1 intento y solo 1,8 horas — el más rápido. GPT-5.6 Sol requirió 1 intento adicional, pero resultó el más económico (entre 10 y 50 dólares por ejecución). Kimi K3 de Moonshot AI también alcanzó el 42/42, aunque requirió 4 intentos más y mayor volumen de tokens. Axiom Math verificó todo formalmente en Lean — el único con prueba matemática verificable por máquina.

La distinción crítica: independiente vs. oficial

El detalle que la mayoría de los titulares pasó por alto: estas puntuaciones se obtuvieron en un entorno de evaluación independiente, no a través del canal oficial de la IMO. La evaluación fue realizada por agentes de Claude, no por jueces humanos exmedallistas ni coordinadores oficiales. El repositorio de GitHub de Das especifica claramente que las puntuaciones deben considerarse sólidas, pero no autoritativas.

Esto contrasta con la IMO 2025, donde OpenAI y Google DeepMind vieron sus soluciones evaluadas oficialmente, alcanzando ambas un 35/42 — nivel de medalla de oro.

La señal más importante: saturación

La trayectoria es evidente: plata en 2024, oro oficial en 2025 (35/42) y puntuaciones perfectas independientes en 2026. La IMO se está saturando como benchmark de razonamiento matemático. Vals.ai señala que la IMO ya no permite diferenciar eficazmente entre los modelos de primer nivel. La atención se desplaza hacia la IOI, que aún no está saturada. Claude Fable 5 lidera la IOI con una precisión del 72,25%.

Qué cambia en la práctica

El razonamiento matemático de nivel olímpico está ahora al alcance de cualquier desarrollador por entre 10 y 50 dólares por sesión completa mediante API. "Resuelve problemas de la IMO" deja de ser un factor diferenciador de marketing. El campo de la evaluación se orienta hacia benchmarks más exigentes y alineados con el trabajo real de ingeniería e investigación.