Em 31 de julho de 2026, a DeepSeek lançou o V4 Flash "0731" — atualização significativa do seu modelo budget que subiu 10 pontos no Artificial Analysis Intelligence Index, de 40 para 50 pontos, colocando-o apenas 1 ponto abaixo do GPT-5.6 Luna da OpenAI, lançado em julho de 2026.
No dia 30 de julho, um dia antes, a OpenAI havia cortado o preço do GPT-5.6 Luna em 80% e do GPT-5.6 Terra em 20%. A coincidência temporal não é coincidência — é pressão competitiva.
A matemática que o mercado precisa entender
DeepSeek V4 Flash-0731: US$ 0,15/1M tokens de input, US$ 0,29/1M tokens de output. GPT-5.6 Luna (após corte de 80%): US$ 0,20/1M tokens de input, US$ 1,20/1M tokens de output. O output do DeepSeek é aproximadamente 4x mais barato.
Em benchmarks de coding, o GPT-5.6 Luna entrega 67,2% no DeepSWE contra 53,3% do V4 Flash — diferença de 14 pontos percentuais. O custo por tarefa no DeepSWE: US$ 0,61 para o Luna, US$ 0,10 para o Flash. 6x mais barato.
A arquitetura do V4 Flash
284 bilhões de parâmetros totais, 13 bilhões ativos — arquitetura MoE sparse com 256 experts roteados e 6 ativos por token. Janela de contexto de 1 milhão de tokens. Licença MIT — pesos disponíveis no HuggingFace para quem quiser rodar localmente. O update "0731" adicionou suporte nativo a Responses-API e Codex, com foco em agentes e coding.
O que isso significa para o mercado
A DeepSeek voltou a fazer o que fez em janeiro de 2026 com o V3: forçar o mercado a repensar a relação custo-qualidade. A diferença agora é que os modelos proprietários já cortaram preço em resposta — o que comprova que a pressão funciona.
Para equipes com workloads sensíveis a custo: V4 Flash. Para workloads de alta precisão com integração no ecossistema OpenAI: GPT-5.6 Luna. Para a maioria dos agentes em produção: uma combinação dos dois — Flash como filtro de baixo custo, Luna para as tarefas de alta exigência.

