Desde el lanzamiento del o1 de OpenAI en septiembre de 2024, y especialmente tras el DeepSeek-R1 en enero de 2025, una pregunta técnica domina los laboratorios de investigación: los modelos de razonamiento, ¿están realmente razonando — derivando conclusiones nuevas a partir de premisas — o están ejecutando una recuperación sofisticada de patrones memorizados durante el entrenamiento?

La respuesta importa porque determina los límites reales de estas arquitecturas. Si se trata de razonamiento genuino, los modelos pueden resolver problemas que nunca han visto. Si es memorización avanzada, su utilidad colapsa exactamente en los problemas donde más importa: los inéditos.

Qué Son los Modelos de Razonamiento

Modelos como el o1, el o3 y el DeepSeek-R1 difieren de los LLMs convencionales en una dimensión fundamental: reciben un presupuesto de cómputo para "pensar" antes de responder. Esta cadena de pensamiento intermedia es visible en el DeepSeek-R1 (open weights) y en el Gemini 2.5, pero es opaca en los modelos de OpenAI.

El modelo o3 introdujo el cómputo adaptativo: preguntas simples reciben cadenas cortas; problemas complejos reciben cadenas largas. El resultado práctico fue sustancial — DeepSeek-R1 mejoró su precisión en el benchmark AIME del 15,6% al 71% utilizando razonamiento extendido. Este salto no provino de parámetros adicionales, sino de más poder de cómputo en el tiempo de inferencia.

Lo Que DeepSeek-R1 Reveló Sobre Cómo los Modelos Aprenden a Razonar

El aspecto más científicamente interesante de DeepSeek-R1 no fue su rendimiento — fue su método de entrenamiento. En lugar de supervisar el proceso de razonamiento paso a paso (como probablemente hace o1), DeepSeek utilizó GRPO — una forma de aprendizaje por refuerzo donde el modelo descubre cómo razonar por ensayo y error, siendo recompensado solo por acertar la respuesta final.

El modelo no recibió instrucciones sobre "cómo razonar". Desarrolló estructuras de razonamiento por su cuenta. Este es un resultado significativo: el comportamiento de razonamiento sofisticado puede surgir del aprendizaje por refuerzo sin conjuntos de datos masivos de razonamiento supervisado. La investigación "Thoughtology", publicada en Transactions on Machine Learning Research en 2026, analizó sistemáticamente el comportamiento de razonamiento del DeepSeek-R1 y descubrió que sus pensamientos siguen una estructura coherente — similar a los patrones de procesamiento del lenguaje humano.

El Problema: El Razonamiento No Es Universal

La evidencia que complica la narrativa optimista: el razonamiento no es uniformemente mejor. Investigaciones de 2025–2026 muestran que la cadena de pensamiento puede degradar el rendimiento cuando verbalizar el razonamiento introduce una complejidad innecesaria — o cuando la tarea simplemente no requiere un razonamiento secuencial.

Un estudio que comparó DeepSeek-R1 y o3-mini en la evaluación de la traducción automática y la sumarización mostró resultados contraintuitivos: o3-mini mejoró con el razonamiento extendido en la traducción, pero DeepSeek-R1 en general tuvo un rendimiento inferior al de su variante sin razonamiento en las mismas tareas — excepto en la evaluación de consistencia de la sumarización. El razonamiento ayuda en los problemas que requieren inferencia en múltiples etapas. Entorpece en tareas que no lo requieren.

El Cómputo en el Tiempo de Inferencia: La Inversión del Paradigma

La implicación arquitectónica más profunda de los modelos de razonamiento es la inversión del paradigma del cómputo. Desde 2017, la IA ha estado dominada por el entrenamiento — la mayor parte de la inversión computacional se destina a crear el modelo, y la inferencia es barata. Los modelos de razonamiento invirtieron parcialmente esto: el costo de cómputo en la inferencia crece con la complejidad del problema.

Los analistas proyectan que para 2030, el cómputo de inferencia representará el 75% del total del cómputo en IA — una inversión completa del paradigma dominante de los años 2020. Esto tiene implicaciones directas para el hardware (quién se beneficia de una inferencia eficiente en lugar de un entrenamiento masivo) y para la arquitectura (los modelos dispersos y MoE ganan relevancia adicional porque reducen el costo por token en la inferencia).

La Pregunta Abierta

La investigación sobre interpretabilidad mecanicista — especialmente el trabajo de Anthropic de 2025–2026 sobre el rastreo de circuitos — está empezando a iluminar lo que sucede internamente durante una cadena de pensamiento. Los primeros resultados sugieren que los modelos forman representaciones intermedias genuinas durante el razonamiento, no solo recuperan patrones. Pero "genuino" y "útil para problemas inéditos" no son sinónimos.

La cuestión entre razonamiento y memorización sigue abierta — y es una de las más importantes en la investigación de frontera en 2026. Porque la respuesta determina si los próximos modelos serán más capaces por ser más inteligentes, o simplemente por haber memorizado más.