El 31 de julio de 2026, DeepSeek lanzó el V4 Flash "0731" — una actualización significativa de su modelo budget que subió 10 puntos en el Artificial Analysis Intelligence Index, de 40 a 50 puntos, ubicándolo solo 1 punto por debajo del GPT-5.6 Luna de OpenAI, lanzado en julio de 2026.
El 30 de julio, un día antes, OpenAI había recortado el precio del GPT-5.6 Luna en un 80% y del GPT-5.6 Terra en un 20%. La coincidencia temporal no es coincidencia — es presión competitiva.
La matemática que el mercado necesita entender
DeepSeek V4 Flash-0731: US$ 0,15/1M tokens de entrada, US$ 0,29/1M tokens de salida. GPT-5.6 Luna (tras el corte del 80%): US$ 0,20/1M tokens de entrada, US$ 1,20/1M tokens de salida. La salida del DeepSeek es aproximadamente 4 veces más barata.
En benchmarks de coding, el GPT-5.6 Luna entrega un 67,2% en DeepSWE frente al 53,3% del V4 Flash — una diferencia de 14 puntos porcentuales. El costo por tarea en DeepSWE: US$ 0,61 para Luna, US$ 0,10 para Flash. 6 veces más barato.
La arquitectura del V4 Flash
284 mil millones de parámetros totales, 13 mil millones activos — arquitectura MoE sparse con 256 expertos enrutados y 6 activos por token. Ventana de contexto de 1 millón de tokens. Licencia MIT — pesos disponibles en HuggingFace para quien quiera ejecutarlo localmente. La actualización "0731" agregó soporte nativo para Responses-API y Codex, con enfoque en agentes y coding.
Lo que esto significa para el mercado
DeepSeek volvió a hacer lo que hizo en enero de 2026 con el V3: forzar al mercado a repensar la relación costo-calidad. La diferencia ahora es que los modelos patentados ya han recortado precios en respuesta — lo que demuestra que la presión funciona.
Para equipos con cargas de trabajo sensibles al costo: V4 Flash. Para cargas de trabajo de alta precisión integradas en el ecosistema OpenAI: GPT-5.6 Luna. Para la mayoría de los agentes en producción: una combinación de ambos — Flash como filtro de bajo costo, Luna para tareas de alta exigencia.

