Durante casi una década, la hipótesis del escalado fue la biblia de la investigación en IA: modelos más grandes, entrenados con más datos y más potencia computacional, producen modelos mejores de manera predecible. Las Leyes de Escalado de Kaplan de 2020 formalizaron esto matemáticamente. Las Leyes de Escalado de Chinchilla de 2022 refinaron las proporciones óptimas entre parámetros y tokens. Y los resultados empíricos lo confirmaron: de GPT-3 a GPT-4, cada generación era sustancialmente mejor.

En 2026, esta narrativa encontró una resistencia creciente. No porque los modelos dejaran de mejorar — sino porque el costo de cada incremento de mejora creció de tal manera que pone en duda la sostenibilidad del paradigma.

El Problema del Costo Exponencial

Los números son concretos. Se estima que GPT-4 costó US$ 100 millones en entrenamiento. Los modelos de la próxima generación, siguiendo el paradigma del escalado puro, requerirían US$ 1.000 millones o más. Epoch AI proyecta que este costo continuará creciendo de manera exponencial — y que la mayoría de las organizaciones que hoy entrenan modelos de frontera dejarán de poder financiar la próxima generación.

Más preocupante aún: Lilian Weng, en un análisis publicado en su influyente Lil'Log, detalló que los ajustes de la ley de potencias que sustentan las leyes de escalado son más sensibles a las elecciones de implementación de lo que los profesionales reconocen. Los resultados son replicables en condiciones controladas — pero las ejecuciones de entrenamiento reales implican experimentos fallidos, barridos de hiperparámetros y sesiones de depuración que pueden duplicar o triplicar el costo final reportado. Los US$ 5,6 millones de DeepSeek-V3 excluyeron la infraestructura, la experimentación y las ejecuciones fallidas.

El Muro de Datos

Paralelo al problema del costo, existe el muro de datos. Epoch AI proyecta que el stock de texto público de alta calidad disponible para el pre-entrenamiento se agotará por completo entre 2026 y 2032, a las tasas de entrenamiento actuales. Los laboratorios de frontera ya se enfrentan a restricciones en su presupuesto de tokens únicos.

El marco Chinchilla fue construido asumiendo datos únicos infinitos. Cuando los tokens únicos se agotan, los laboratorios deben entrenar con datos repetidos — y la investigación de Muennighoff et al. (2023) demostró que los tokens repetidos no diluyen la eficiencia del entrenamiento linealmente: su valor decae exponencialmente con cada repetición, con una constante que determina qué tan rápido cada paso adicional sobre los mismos datos pierde su rendimiento.

DeepSeek como Prueba de Concepto de Eficiencia

El "Momento DeepSeek" de enero de 2025 fue el evento que cristalizó la transición. DeepSeek-V3 — 671.000 millones de parámetros totales, pero con un modelo de Mezcla de Expertos (MoE) con solo 37.000 millones activos por token — fue entrenado en 14,8 billones de tokens por un costo reportado de US$ 5,6 millones. Ofrecía un rendimiento competitivo con GPT-4o. Tenía licencia del MIT. Se podía descargar.

El impacto en el mercado fue inmediato: NVIDIA perdió aproximadamente US$ 589.000 millones en capitalización de mercado el 27 de enero de 2025 — la mayor pérdida de valor en un solo día en la historia del mercado de valores. El evento invalidó en un solo ciclo de noticias la premisa dominante de que la IA de frontera exigía una infraestructura masiva controlada por Estados Unidos.

En 2026, DeepSeek-V3.2 iguala a GPT-5 en varios benchmarks clave, funciona a un costo aproximadamente un 70% menor y tiene licencia del MIT. La lección: la innovación arquitectónica puede sustituir a la escala bruta.

El Giro hacia la Inferencia

La estrategia del campo ha migrado. En lugar de "quién tiene más GPUs", la pregunta en 2026 es "quién tiene la arquitectura más eficiente". El fine-tuning de modelos pre-entrenados con LoRA puede costar entre US$ 500 y US$ 5.000 — una fracción de los millones necesarios para entrenar desde cero. La destilación de DeepSeek-R1 a 7B mantiene el 85% de su rendimiento. Llama 4 de Meta y los últimos lanzamientos de Mistral adoptaron estrategias de atención latente y MoE similares a las de DeepSeek.

Las leyes de escalado no han muerto — pero han sido relativizadas. Lo que escala ya no son solo los parámetros y los datos: es la eficiencia arquitectónica, la calidad de los datos por encima de la cantidad, y el poder de cómputo para la inferencia sobre el poder de cómputo para el entrenamiento. El paradigma de 2026 es la eficiencia primero, no la escala primero.