El estancamiento que nadie quiere admitir
La hipótesis de escala fue la fuerza motriz de la carrera entre OpenAI, Google y Anthropic en los últimos cinco años: modelos más grandes, entrenados con más datos, con más cómputo, producen modelos más capaces de forma predecible. Las Chinchilla Scaling Laws de Hoffmann et al. (2022) refinaron las proporciones ideales entre parámetros y tokens de entrenamiento. GPT-4, Gemini 2.0 y Claude 4 fueron los productos de esta fe.
Pero los datos de benchmark cuentan una historia diferente. La mejora marginal en MMLU (Massive Multitask Language Understanding) y GPQA Diamond se está volviendo estadísticamente visible como una tendencia decreciente. El costo computacional para cada incremento crece exponencialmente: se estima que entrenar GPT-4 costó US$ 100 millones; los modelos de próxima generación en el paradigma de escala pura pueden requerir US$ 1.000 millones o más.
Esto no significa que los modelos dejaron de mejorar — significa que la relación costo-beneficio de la escala está cambiando. Y este cambio abre espacio para alternativas que eran académicamente interesantes pero económicamente marginales cuando la escala aún entregaba retornos crecientes.
Los tres retadores: SSM, MoE y computación neuromórfica
Tres familias de arquitecturas ganan tracción simultánea en los laboratorios de investigación de frontera, según un análisis de publicaciones en arXiv y NeurIPS 2025.
State Space Models (SSM): Mamba (Gu & Dao, 2023) propone procesar secuencias con complejidad lineal en lugar de la cuadrática de los transformers — una ventaja fundamental para contextos muy largos. Los primeros resultados muestran un rendimiento competitivo con transformers de tamaño equivalente en tareas específicas. Mamba-2 y variantes híbridas como Jamba (SSM + transformer) están siendo evaluadas en producción por múltiples laboratorios. La cuestión empírica aún abierta es si los SSM mantienen la ventaja al escalar a los tamaños de los modelos de frontera.
Mixture of Experts (MoE): Ya está en producción. Mixtral 8×7B de Mistral AI y presumiblemente GPT-4 utilizan MoE. En lugar de activar todos los parámetros para cada token, MoE activa solo un subconjunto de "expertos", permitiendo modelos con una enorme capacidad total pero el costo de inferencia de un modelo más pequeño. DeepSeek-V3, lanzado en diciembre de 2025, demostró que un MoE bien construido supera a modelos de mayor escala con una fracción del costo de entrenamiento — un resultado que sacudió al sector y llevó a un reajuste de precios en las acciones de empresas de infraestructura de IA.
Sistemas modulares y cognitivos: El análisis de Bessemer Venture Partners publicado en julio de 2026 identifica una transición de "modelos monolíticos" a "sistemas cognitivos modulares" como la principal tendencia de infraestructura de IA para los próximos 24 meses. En lugar de un modelo que hace todo, la arquitectura emergente involucra módulos especializados: uno genera, otro verifica, otro razona, otro planifica, con memoria y recuperación que envuelve todo. Esto se acerca más a cómo funcionan los sistemas biológicos de procesamiento de información que el transformer clásico.
World models: la apuesta a largo plazo
La más ambiciosa de las fronteras de investigación es la de los world models — sistemas que construyen representaciones internas del funcionamiento del mundo físico y causal, no solo patrones estadísticos en texto. Yann LeCun, de Meta AI, ha defendido este enfoque como el camino hacia la inteligencia genuina desde 2022. La arquitectura JEPA (Joint Embedding Predictive Architecture) es la implementación más desarrollada de esta visión.
El debate con los defensores de los LLM a gran escala es fundamentalmente empírico: si los world models demuestran un razonamiento físico confiable mientras los LLM continúan fallando en la física intuitiva, el centro de gravedad de la investigación se desplaza permanentemente. Si los LLM aprenden suficiente física a partir de datos a escala, el argumento de los world models pierde fuerza.
En 2026, los primeros resultados de sistemas híbridos — LLM con world models como módulos de razonamiento especializado — comienzan a aparecer en arXiv. El veredicto aún no ha llegado.
Lo que dicen los datos de publicación
El análisis de tendencias de envío a NeurIPS 2025 e ICML 2026 muestra un crecimiento del 340% en papers sobre SSM y arquitecturas de state space en relación con 2023, un crecimiento del 180% en papers sobre MoE y sparse models, y un crecimiento del 220% en papers sobre world models y representaciones causales. En contraste, los papers sobre scaling laws puras crecieron solo un 12%.
El mercado de papers no es el mercado de productos — hay un rezago de 18 a 36 meses entre un descubrimiento de frontera y su incorporación en sistemas de producción. Pero la señal es clara: el campo está apostando por la diversificación arquitectónica, no en más escala de lo mismo.
Lo que el Laboratorio monitorea
PrezencIA indexa papers de arXiv, NeurIPS, ICML e ICLR con un enfoque en investigación de frontera relevante para aplicaciones prácticas en 18–36 meses. No cubrimos cada paper — cubrimos lo que mueve el campo. Los criterios editoriales del Laboratorio priorizan resultados replicables, benchmarks independientes y evidencia de transferencia a aplicaciones reales.
La tensión central que monitoreamos: las arquitecturas prometedoras necesitarán superar no solo el benchmark técnico, sino todo el ecosistema de herramientas, hardware y experiencia construido en torno al transformer. La historia de la computación está repleta de arquitecturas superiores que fracasaron en su adopción por razones de ecosistema. El transformer ha demostrado ser resiliente exactamente porque es bien comprendido, optimizable y compatible con la infraestructura de GPU existente.

