EXP_001 / LOCAL AI
Modelos grandes. Hardware pequeño.
Hasta dónde llegan los modelos open-weight en una workstation común, y qué cambia eso en un stack de IA.
01 La pregunta
¿Hasta dónde llegan los modelos de IA actuales sin infraestructura especializada?
Empezó como un experimento con LLMs locales y terminó siendo un estudio de todo el stack de inferencia: cuantización, GPU offloading, KV cache, ventanas de contexto, arquitecturas MoE y los trade-offs entre memoria, velocidad y calidad.
02 Lo que aprendí
Un buen modelo ya no necesita un data center.
Los modelos open-weight de Qwen, Llama, Gemma y DeepSeek mostraron que la buena calidad ya no es exclusiva de infraestructura cloud costosa.
Con la combinación correcta de cuantización, GPU offloading, Flash Attention, configuración de KV cache y gestión de contexto, modelos que parecían imprácticos se volvieron realmente útiles en una workstation común. Lo mismo vale para la generación de imágenes local: resultados de alta calidad sin depender por completo de APIs externas.
Las limitaciones de hardware suelen ser un problema de optimización antes que un problema de hardware.
03 Qué cambia
De hipótesis a pieza de construcción.
La IA local dejó de ser una idea interesante y pasó a ser un componente práctico: herramientas internas que corren en la infraestructura de la empresa, mantienen las cargas sensibles adentro, tienen costos operativos previsibles y siguen disponibles sin depender de los límites de APIs de terceros.
Eso no convierte a los modelos locales en reemplazo de los modelos frontier. El razonamiento exigente y las cargas de producción de alto volumen todavía requieren mucho cómputo. Los modelos locales no necesitan reemplazarlos para aportar valor.
No es solo IA más barata. Es un stack de IA más resiliente.
Modelos frontier donde importa la máxima inteligencia. Modelos locales donde importan más el costo, la latencia, la privacidad, la disponibilidad y la especialización.
04 Mi punto justo
Una workstation común, ajustada como un solo sistema.
Un modelo Qwen 28B MoE cuantizado fue una de las combinaciones más interesantes: lo bastante chico para repartirse entre GPU y memoria del sistema, con la calidad que buscaba para experimentos reales de desarrollo.
- GPU
- RTX 4070 · 12 GB VRAM
- MEMORIA
- 64 GB de RAM
- RUNTIME
- llama.cpp
- MODELOS
- Cuantizados, clase 20–30B
- CONTEXTO
- ~65K cuando hace falta
La clave no fue un modelo ni un parámetro puntual. Fue entender cómo funciona todo el stack de inferencia en conjunto:
- 01ARQUITECTURA DEL MODELO
- 02CUANTIZACIÓN
- 03ASIGNACIÓN DE VRAM
- 04KV CACHE
- 05TAMAÑO DE CONTEXTO
- 06GPU OFFLOAD
- 07THROUGHPUT
Ajustado en conjunto, un hardware que en papel parecía insuficiente resultó sorprendentemente capaz.
La pregunta cambió
¿Podemos correr esto localmente?
¿Qué partes del sistema deberían correr localmente?