p.PABLO CARDOZONEGOCIO × INGENIERÍA
EN/ES
navegarabrir
Entrar al lab

EXP_001 / LOCAL AI

Modelos grandes. Hardware pequeño.

Hasta dónde llegan los modelos open-weight en una workstation común, y qué cambia eso en un stack de IA.

STATUS
NOTAS DE CAMPO / VERIFICADO
RUNTIME
llama.cpp
GPU
RTX 4070 · 12 GB
CONTEXTO
~65K

01 La pregunta

¿Hasta dónde llegan los modelos de IA actuales sin infraestructura especializada?

Empezó como un experimento con LLMs locales y terminó siendo un estudio de todo el stack de inferencia: cuantización, GPU offloading, KV cache, ventanas de contexto, arquitecturas MoE y los trade-offs entre memoria, velocidad y calidad.

02 Lo que aprendí

Un buen modelo ya no necesita un data center.

Los modelos open-weight de Qwen, Llama, Gemma y DeepSeek mostraron que la buena calidad ya no es exclusiva de infraestructura cloud costosa.

Con la combinación correcta de cuantización, GPU offloading, Flash Attention, configuración de KV cache y gestión de contexto, modelos que parecían imprácticos se volvieron realmente útiles en una workstation común. Lo mismo vale para la generación de imágenes local: resultados de alta calidad sin depender por completo de APIs externas.

Las limitaciones de hardware suelen ser un problema de optimización antes que un problema de hardware.
FIG. 01 / AJUSTE DE MEMORIA01 / 04 · NO ENTRA
Ilustrativo, sin escala. Cómo un modelo que no entra pasa a ser uno que funciona.

03 Qué cambia

De hipótesis a pieza de construcción.

La IA local dejó de ser una idea interesante y pasó a ser un componente práctico: herramientas internas que corren en la infraestructura de la empresa, mantienen las cargas sensibles adentro, tienen costos operativos previsibles y siguen disponibles sin depender de los límites de APIs de terceros.

Eso no convierte a los modelos locales en reemplazo de los modelos frontier. El razonamiento exigente y las cargas de producción de alto volumen todavía requieren mucho cómputo. Los modelos locales no necesitan reemplazarlos para aportar valor.

No es solo IA más barata. Es un stack de IA más resiliente.

Modelos frontier donde importa la máxima inteligencia. Modelos locales donde importan más el costo, la latencia, la privacidad, la disponibilidad y la especialización.
FIG. 02 / STACK HÍBRIDOMODELOS FRONTIER
Enrutar según lo que necesita cada carga, no por costumbre.

04 Mi punto justo

Una workstation común, ajustada como un solo sistema.

Un modelo Qwen 28B MoE cuantizado fue una de las combinaciones más interesantes: lo bastante chico para repartirse entre GPU y memoria del sistema, con la calidad que buscaba para experimentos reales de desarrollo.

GPU
RTX 4070 · 12 GB VRAM
MEMORIA
64 GB de RAM
RUNTIME
llama.cpp
MODELOS
Cuantizados, clase 20–30B
CONTEXTO
~65K cuando hace falta

La clave no fue un modelo ni un parámetro puntual. Fue entender cómo funciona todo el stack de inferencia en conjunto:

FIG. 03 / STACK DE INFERENCIAETAPA 01
  1. 01ARQUITECTURA DEL MODELO
  2. 02CUANTIZACIÓN
  3. 03ASIGNACIÓN DE VRAM
  4. 04KV CACHE
  5. 05TAMAÑO DE CONTEXTO
  6. 06GPU OFFLOAD
  7. 07THROUGHPUT
Cada etapa condiciona a la siguiente. Ajustas una y revisas el resto.

Ajustado en conjunto, un hardware que en papel parecía insuficiente resultó sorprendentemente capaz.

La pregunta cambió

¿Podemos correr esto localmente?

¿Qué partes del sistema deberían correr localmente?

Siguiente experimentoCuando los agentes colaboran.