A Olimpíada Internacional de Matemática de 2026 (IMO) terminou na última semana de julho com um resultado que teria sido impensável dois anos atrás: três modelos de linguagem de fronteira atingiram pontuação perfeita de 42/42 nos seis problemas da competição mais prestigiada de matemática do mundo para estudantes do ensino secundário.

O Que Aconteceu

Deedy Das, sócio da Menlo Ventures e investidor da Anthropic, construiu um harness de avaliação independente e submeteu os problemas do IMO 2026 a quatro modelos de fronteira. Os resultados: Claude Fable 5 completou 42/42 em 1 tentativa e apenas 1,8 horas — o mais rápido. GPT-5.6 Sol precisou de 1 tentativa adicional mas foi o mais barato (entre $10-50 por run). Kimi K3 da Moonshot AI chegou ao 42/42 mas exigiu 4 tentativas a mais e um volume muito maior de tokens. Axiom Math provou tudo formalmente em Lean — o único com prova matemática verificável por máquina.

Os problemas P3 e P6 foram os mais difíceis. Estudantes humanos têm 9 horas distribuídas em duas sessões para resolver os 6 problemas. Fable e Sol completaram em menos de 4 horas.

A Distinção Crítica: Independente vs Oficial

O detalhe que a maioria das manchetes ignorou: estes scores foram obtidos num harness independente, não no canal oficial da IMO. A avaliação foi feita por agentes Claude — não por juízes humanos ex-medalhistas nem por coordenadores da IMO. O próprio repositório GitHub de Das é explícito: os scores devem ser tratados como fortes mas não autoritativos.

Isto contrasta com o IMO 2025, onde OpenAI e Google DeepMind tiveram as soluções avaliadas oficialmente por coordenadores da IMO, ambas atingindo 35/42 (nível medalha de ouro).

O Sinal Mais Importante: Saturação

A trajectória é clara: prata em 2024, ouro em 2025 (35/42), e scores perfeitos independentes em 2026. O IMO está a saturar como benchmark de raciocínio matemático para modelos de fronteira. O relatório do vals.ai é explícito: o IMO pode não diferenciar efectivamente entre modelos de topo. A atenção começa a mover-se para a IOI (Olimpíada Internacional de Informática), que ainda não está saturada. Claude Fable 5 lidera o IOI com 72,25% de accuracy.

O Que Muda na Prática

O raciocínio matemático de nível olímpico está agora acessível a qualquer desenvolvedor por $10-50 por sessão completa via API. "O modelo resolve IMO" deixa de ser um diferenciador de marketing, pois múltiplos modelos o fazem. O campo de avaliação está a deslocar-se para benchmarks mais difíceis e mais alinhados com trabalho real.