A Stack de IA Local: Soberania Total
La stack de IA que elijas hoy define tu soberanía de datos mañana. Dependencias de API generan bloqueo. Modelos locales generan autonomía. Las Stacks del PrezencIA mapean pilas tecnológicas con criterios técnicos honestos — hardware, software, costos operActivos y los trade-offs que ningún proveedor te cuenta.
Por qué la elección de stack es una decisión estratégica
La elección de stack de IA no es una decisión técnica — es una decisión estratégica. Una empresa que rodó 2 años en API de OpenAI construyó dependencia profunda: código acoplado a formatos específicos, equipo entrenado en una interfaz particular, costos escalando con el uso. Migrar a un modelo alternativo cuesta meses de ingeniería. La pregunta que debería hacerse antes de cualquier implementación es: en 5 años, quiero ser cliente de esta API o quiero tener capacidad propia?
La stack de IA local no es solución para todo caso de uso. APIs comerciales son adecuadas para prototipado, para volúmenes bajos-medios sin datos sensibles, y para casos en los que la latencia no es crítica. La stack local tiene sentido cuando: los datos sensibles no pueden salir de la infraestructura, el volumen es alto suficiente para amortizar el hardware, o la organización tiene equipo técnico para elperar modelos.
El concepto de soberanía computacional ha ganado dimensión geopolítica en 2026. Países y organizaciones que dependen de IA servida exclusivamente por proveedores americanos o chinos tienen dependencia estratégica real — de la misma manera que la dependencia energética. La stack local no es solo eficiencia operativa — es infraestructura crítica.
15 Términos que Definen Stacks
Terminología de infraestructura para los Pointy Stacks. Utilizada de forma consistente para describir componentes de pilas tecnológicas de IA.
| Término | Definición Editorial | Nivel |
|---|---|---|
| Ollama | Servidor local para modelos open source — API compatible con OpenAI, soporta Mac/Linux/Windows | Oro |
| vLLM | Servidor de inferencia de alta rendimiento — PagedAttention para throughput máximo en GPU | Oro |
| GGUF | Formato de cuantización de modelos — desarrollado por llama.cpp; estándar para inferencia CPU/GPU mixta | Oro |
| llama.cpp | Inferencia de LLMs en C++ puro — corre en CPU, base del Ollama | Oro |
| VRAM | Video RAM — gargalo de hardware; regla: parámetros × bytes por peso × 1.2 de overhead | Diamante |
| Cuantización | INT4/INT8/FP16 — equilibrio entre tamaño, velocidad y calidad; Q4_K_M como equilibrio estándar | Diamante |
| RTX 3.060/4060 | GPUs de consumo con 12 GB de VRAM — suficiente para modelos de 13 a 20 B cuantizados | Oro |
| H100/A100 | GPUs de centro de datos — 80 GB de HBM; necesarias para modelos de 70 B+ sin cuantización agresiva | Oro |
| Apple Silicon | M1/M2/M3 con memoria unificada — excelente para modelos de 7 a 30 B; Metal acelera la inferencia | Oro |
| LM Studio | Interfaz gráfica para ejecutar modelos locales — alternativa al Ollama para no técnicos | Plata |
| Pinecone/Qdrant | Bases de datos vectoriales gestionadas vs. autogestionadas — equilibrio costo vs. control | Oro |
| Ray Serve | Framework para servir modelos en clúster — distribuye carga entre múltiples GPUs | Plata |
| Servidor de inferencia Triton | NVIDIA — servidor de inferencia en producción; soporta ensamblaje de modelos | Plata |
| TCO | Costo total de posesion — hardware + energia + mantenimiento vs. costo de API a escala | Diamante |
| Inferencia en lote | Procesamiento asincrono en lote — mejoral throughput 5-10 veces en comparacion con solicitudes sincronas | Oro |
Pila de IA Local: Hardware y Software para Máxima Soberanía de Datos
Armar una pila de IA local en 2026 ya no requiere más centro de datos — requiere decisión de arquitectura. El hardware de consumo ha llegado al punto en que un servidor de desarrollo con una RTX 4090 (24GB VRAM) ejecuta Llama 3.1 70B cuantizada en 4-bit con calidad útil. La cuestión ya no es "¿es posible?", sino "¿cuál pila tiene sentido para mi caso de uso?".
Pila 1: Desarrollo (Presupuesto R$ 8.000-15.000)
Hardware: Estación de trabajo con i7/Ryzen 7, 64GB RAM, RTX 3060 12GB o RTX 4060 Ti 16GB. Software: Ubuntu 22.04 LTS, Ollama para servir modelos, Qdrant a través de Docker para RAG, FastAPI para APIs internas. Modelos recomendados: Llama 3.1 8B (rápido, para prototipado), Mistral 7B (multilingüe, bueno en portugués), Phi-3 Medium (compacto, sorprendentemente capaz). Aplica cuando: desarrollo, pruebas, proyectos internos de bajo volumen.
Pila 2: Producción Media (Presupuesto R$ 30.000-80.000)
Hardware: Servidor con 2× RTX 4090 24GB (o 1× A10G 24GB), 128GB RAM, NVMe de alta velocidad. Software: vLLM para servicio con PagedAttention, Qdrant cluster, Nginx como proxy inverso, monitoreo mediante Prometheus/Grafana. Modelos: Llama 3.1 70B Q4_K_M (4 bits que caben en 40GB VRAM), Qwen 2.5 72B para multilingüe. Capacidad: 50-200 solicitudes simultáneas, throughput de 20-60 tokens/segundo.
"Una empresa que invierte R$ 50.000 en hardware de IA local y evita R$ 15.000/mes en APIs recupera su inversión en 3-4 meses — y gana soberanía permanente sobre sus datos." — Análisis de TCO PrezencIA, 2026
El cálculo del TCO
La cuenta que pocos hacen: costo de API a $0.015 por 1.000 tokens, con 10 millones de tokens al mes = $1.500/mes = $18.000/año. Un servidor con RTX 4090 (R$ 12.000) + hosting (R$ 500/mes) + energía (R$ 300/mes) = R$ 12.000 al inicio + R$ 9.600/año. En 18 meses, el hardware se paga — y a partir de entonces el costo marginal es solo energía y mantenimiento. Para volúmenes superiores a 5M tokens/mes, la stack local es económicamente superior en cualquier horizonte razonable.