
IA local vs IA en la nube en 2026: cuándo te conviene cada una (guía para founders)
Quick answer (60 segundos)
La decisión entre IA local (correr un LLM open-weight en tu hardware) e IA en la nube (consumir Anthropic, OpenAI, DeepSeek o similar vía API) no es blanco/negro: depende de 5 variables que podés evaluar en 20 minutos. Como regla de pulgar: si pasás 30M tokens/mes y tu data es sensible (PII, salud, legal), local es 5-20× más barato y te resuelve compliance. Si estás bajo 1M tok/mes y tu data es pública, la nube es 50-200× más barata y te ahorra DevOps. En el medio (1M-30M tok/mes con sensibilidad media), un enfoque híbrido — modelos baratos en la nube, modelos grandes local — suele ganar.
Disclosure: los precios de la nube que cito abajo son públicos al 15 de agosto del 2026 (Anthropic, OpenAI, DeepSeek, Together, Fireworks). Los benchmarks de hardware local son míos sobre M3 Max 128 GB y servidores dedicados equivalentes. Donde tiro un número de throughput sin fuente exacta, está medido por mí. Tu número real depende del modelo y tu distribución input/output; el cálculo está desglosado para que recalcules.
La pregunta mal planteada
El mercado te empuja a elegir: o te dicen "local es el futuro, ahorrás USD 50K al año", o "nube es siempre más barato, no te metas". Las dos son simplificaciones. La pregunta correcta es: ¿cuál es el costo total — CAPEX + OPEX + DevOps + riesgo de compliance — para tu volumen, tu latencia, tu sensibilidad de datos y tu equipo, hoy y dentro de 12 meses?
Este post te da una herramienta para responderla en 20 minutos: 5 variables duras, una tabla comparativa, un case study con 4 escenarios y 6 recomendaciones por perfil de founder. Si después de leerlo no podés decidirte, no es que el post esté flojo — es que tu caso es híbrido y te conviene un split.
1. Las 5 variables que deciden
1.1 Volumen de tokens/mes
El primer corte es volumen. Bajo 1M tok/mes es hobby o pre-producto; sobre 50M tok/mes ya estás en SaaS mediano. Los umbrales prácticos en 2026:
| Volumen | Implicancia típica |
|---|---|
| <1M tok/mes | Pre-producto, MVP, demos. La nube es 50-200× más barata. |
| 1-10M tok/mes | Producto en producción, early traction. Evaluar caso por caso. |
| 10-50M tok/mes | Producto escalando. La frontera entre nube y local se cruza. |
| 50M+ tok/mes | Producto maduro. Local puro o híbrido suelen ganar. |
Midelo en tokens input + output. Una interacción típica de un agente SaaS son 2K input + 800 output; un feature de chat con RAG puede ser 5K+2K. Multiplicá por usuarios activos por mes por interacciones por usuario. Si no lo medís, instrumentalo primero: te cuesta 1 tarde y define toda tu estrategia.
1.2 Sensibilidad de los datos
El segundo corte es qué tan sensible es la data que mandás al LLM. La nube occidental (Anthropic, OpenAI) tiene safeguards pero los datos transitan por infraestructura fuera de Latam. Si tu data es:
- Datos públicos (documentación, papers, código open-source): la nube es perfectamente segura.
- PII identificable (emails, DNI, teléfonos, direcciones): la nube con BAA (Business Associate Agreement) cubre HIPAA; para LGPD Brasil y Ley 1581 Colombia la transferencia internacional exige consentimiento o cláusulas específicas que no todos los proveedores firman. Verificá con tu legal.
- Datos de salud (historias clínicas, prescripciones): HIPAA + local u on-prem es lo único razonable. Mandar PHI sin BAA es romper la ley.
- Datos financieros core (payroll, scoring crediticio propio, modelos de riesgo): local u on-prem con segregación física.
- Código propietario core / secretos comerciales: local, full stop. Tu ventaja competitiva no sale de tu datacenter.
Si tu producto cae en alguna categoría sensible, local no es una opción — es la única opción. En la duda, no firmes BAA por firmar; llamá a tu legal antes de migrar.
1.3 Latencia objetivo
El tercer corte es latencia. La IA en la nube tiene RTT cross-border (US-EU) que suma 100-250 ms desde Latam. Para productos interactivos (chat en tiempo real, voice agents), ese RTT puede ser la diferencia entre "se siente como una persona" y "se siente como un bot".
| Caso de uso | Latencia tolerable | Ganador típico |
|---|---|---|
| Batch offline (resúmenes nocturnos, ETL) | Segundos | Nube |
| Generador in-app (copy, ideas, code completions) | <500ms p50 | Nube con edge cache, o local en mismo datacenter |
| Chat visible para el usuario | <300ms p50 | Local, o nube con cache y fast mode |
| Voice agent (Vapi, Retell, GPT-Live) | <500ms end-to-end | Local o edge, nube US+Latam penaliza |
| Latencia crítica (autocomplete IDE, real-time) | <200ms p50 | Local, full stop |
Cuando la latencia monetiza (voice, autocomplete, búsqueda en vivo), 200-300 ms se traducen directo a conversión. Cuando no (resúmenes batch, generación nocturna), la nube es perfectamente suficiente.
1.4 Presupuesto disponible (CAPEX vs OPEX)
Cuarto corte: ¿podés pagar USD 4,000-8,000 upfront en hardware, o necesitás OPEX mensual? Local es CAPEX: pagás la workstation o el servidor y la depreciás en 3-5 años. Nube es OPEX: pagás por uso.
Si tu runway es corto (<18 meses) y necesitás cash flow predecible, OPEX gana aunque sea más caro por token. Si tu runway es largo y el volumen es alto, CAPEX rinde mejor. Una regla práctica:
- Runway <18 meses, volumen bajo: OPEX (nube) siempre.
- Runway >36 meses, volumen >30M tok/mes: CAPEX (local) gana en 18-24 meses.
- Runway intermedio: arrendar el hardware (servidor dedicado mensual en Hetzner, Latitude, etc.) es OPEX con un break-even más alto.
Y sumá el costo de oportunidad: si DevOps te cuesta USD 100K/año, ese salario paga 25 workstations USD 4K cada una, antes de pagar la nube.
1.5 Expertise técnico del equipo
Quinto corte: ¿tu equipo puede operar self-hosting? Self-hosting no es "comprar hardware y listo": es
- Mantener el modelo actualizado (cuantización, retraining, eval).
- Monitorear throughput, latencia y errores (Helicone, Langfuse, Phoenix).
- Hacer A/B testing contra modelos frontier.
- Resolver incidentes cuando el modelo se cuelga o devuelve basura.
- Optimizar cuantización y KV cache para tu workload.
Si nadie en tu equipo hizo esto antes, no es un bloqueo, pero necesitás un mes de setup, debugging y probablemente un par de miles de dólares en consultor externo para no estar seis meses peleando con llama.cpp. Sin ese buffer, la nube te sale más cara pero te saca del business de "operar infraestructura de IA" y te deja hacer "construir producto sobre IA", que es donde están los retornos.
2. Tabla comparativa — local vs nube
Lee la tabla de izquierda a derecha. Cada fila es un criterio; las columnas son las dos alternativas. La columna de "Ganador" es la tendencia en 2026, no ley universal.
| Criterio | IA local (LLM open-weight) | IA en la nube (API managed) | Ganador |
|---|---|---|---|
| Privacidad de datos | Datos nunca salen de tu infra. Control total. | Datos transitan por infra del proveedor (US-EU). BAA contractual. | Local (si data sensible) |
| Costo variable | USD 0 por token (solo electricidad). | USD 0.27-10 / 1M tok según modelo. | Local a escala |
| Costo fijo | USD 4K-8K hardware, USD 0-200K/año DevOps. | USD 0 fijo. Pagas por uso. | Nube (si volumen bajo) |
| Latencia p50 | <100 ms en LAN / misma región. | 200-500 ms cross-border Latam-US. | Local (si interactivo) |
| Calidad frontier | 6-12 meses detrás del frontier (open-weight = lo que se liberó). | 0-3 meses del último modelo. | Nube |
| Mantenimiento | Tu equipo o contratás. ~20% de tiempo FTE. | Cero. El proveedor mantiene. | Nube |
| Escalabilidad | Lineal con hardware (capex). Difícil auto-scale. | Elástico, auto-scale incluido. | Nube |
| Vendor lock-in | Bajo (cambiás de modelo open-weight sin re-arquitectura). | Alto (cambiar de proveedor = reescribir SDK, evals, prompts). | Local |
| Compliance contractual | Tus datos, tus reglas. Sin BAA. | BAA HIPAA, DPA GDPR, AI Act EU compliance por proveedor. | Empate, depende |
| Tiempo a producción | 2-6 semanas (setup, cuantización, evals). | 1-3 días (API key + SDK). | Nube |
Lectura fila por fila: si tu prioridad es privacidad + costo a escala + vendor lock-in bajo, local gana. Si tu prioridad es velocidad a mercado + calidad frontier + cero mantenimiento, nube gana. En los criterios donde sale "Empate, depende" (compliance), la decisión la toma tu equipo legal, no vos.
3. Case study: 4 escenarios con números reales
Para que la tabla no quede abstracta, tomá estos 4 escenarios. Son representativos de lo que veo en founders Latam. Supuesto: distribución 70% input / 30% output, típica de SaaS B2B Latam. Si tu producto es más output-heavy (voice agents, generación de documentos), recalculávos la columna nube con tu distribución real.
Setup local de referencia: M3 Max 128 GB workstation (USD 4,000) corre Llama 3.1 70B Q4_K_M con contexto 16K a ~7-8 tok/s. Si necesitás más throughput, servidor dedicado USD 8K duplica velocidad. Electricidad ~USD 80/año continuous (workstation); USD 400-800/año continuous (servidor). Mantenimiento: 20% de un DevOps senior → USD 30K/año cargado en USA, USD 15K en Latam.
Setup nube (precios públicos al 2026-08-15):
- Claude Sonnet 5: $2 input / $10 output por 1M tok.
- Claude Opus 5: $5 / $25 (modelo premium).
- DeepSeek V4-Flash: $0.27 / $1.10 (chino, post-aumento ago-2026, muy barato).
- OpenAI GPT-5.6 Terra: $2.50 / $15.
- Self-host open-weight en RunPod/Lambda (H800): $1.50-2.50/hora → $13-22K/año continuous.
Escenario A — SaaS B2B, 1M tok/mes, datos públicos
- Volumen anual: 12M tokens.
- Sensibilidad: documentos públicos (PDFs de marketing, papers, código open).
- Costo local 1 año: USD 4,080 (CAPEX) + USD 80 (electricidad) = $4,160.
- Costo nube 1 año: Sonnet 5 todo input ~$24; 50/50 input/output ~$78; todo output ~$132.
- Ganador: nube gana 55-170×. Local es tirar plata.
- Recomendación: API managed. DeepSeek V4-Flash si querés ahorrar más sin pérdida de calidad significativa.
Escenario B — SaaS salud Latam, 1M tok/mes, datos clínicos
- Volumen anual: 12M tokens.
- Sensibilidad: PHI (historias clínicas). Sin BAA no podés usar la nube.
- Costo local 1 año: USD 4,080 + USD 80 = $4,160 + USD 15-30K DevOps = $19-34K total.
- Costo nube 1 año: USD 24-132 API + USD 12K-24K BAA OpenAI/Anthropic + rehacer contrato + legal = $12-24K API + overhead contractual.
- Ganador: local u on-prem (compliance no es opcional). El cálculo financiero es secundario; el regulatorio manda.
- Recomendación: self-host u on-prem. PHI sin BAA es romper la ley. Ver guía HIPAA para SaaS Latam.
Escenario C — Mid-market Latam, 10M tok/mes, PII media
- Volumen anual: 120M tokens.
- Sensibilidad: PII con contrato DPA (no necesariamente HIPAA).
- Costo local 1 año: USD 4,160 + DevOps medio (USD 50K) = ~$54K.
- Costo nube 1 año: Sonnet 5 todo input ~$240; 50/50 ~$780; Opus 5 mix ~$1,200. + DPA contractual ~USD 5K.
- Ganador: mixto. Sonnet 5 todo input sale $240/año → 220× más barato que local + DevOps. Pero a 50/50 la diferencia es 70×. Cualquier nube gana por paliza en este volumen.
- Recomendación: API managed por ahora. Si pasás 30M tok/mes y empezás a ver >USD 1K/mes solo en API, revisitá local para el modelo grande (70B) y mantené API para los modelos chicos.
Escenario D — High-volume Latam, 50M tok/mes, PII media
- Volumen anual: 600M tokens (4× el escenario anterior).
- Sensibilidad: PII con DPA. Tu contrato permite cloud, pero ya estás mirando los números.
- Costo local 1 año: USD 4,160 + DevOps = ~$54K (mismo setup; el hardware escala bien).
- Costo nube 1 año: Sonnet 5 todo input ~$1,200; 50/50 ~$3,900; Opus 5 mix ~$6,000. DeepSeek V4-Flash todo input: $162 (chino, ~4× más barato que Sonnet 5).
- Ganador: DeepSeek V4-Flash (nube) sale $162 vs USD 54K local — la nube gana 333×. Si no podés usar DeepSeek por compliance (China provider), entonces local con 70B Q4_K_M es $54K vs Sonnet 5/Opus 5 a $3,900-$6,000 — local gana.
- Recomendación: nube con DeepSeek V4-Flash si tu compliance lo permite. Si no, self-host 70B + API para casos donde necesitás frontier.
Cálculo de break-even:
| Escenario | Volumen break-even local vs Sonnet 5 |
|---|---|
| Local puro (sin DevOps, solo electricidad) | ~30M tok/mes |
| Local + DevOps medio (USD 50K/año) | ~5M tok/mes |
| Local + DevOps caro (USD 100K/año) | ~10M tok/mes (calidad cae con quantization) |
El número real depende de tu distribución input/output, tu DevOps y si tenés GPU o CPU. El calculador rápido:
~Costo local mensual = (Hardware / 36 meses) + (Electricidad / 12) + DevOps / 12 Costo nube mensual = Volumen_in × Precio_in + Volumen_out × Precio_out Break-even: Costo local mensual = Costo nube mensual
Si querés que te corra este cálculo con tu volumen real en 20 minutos, reservá una llamada gratis — solemos poder decirte exacto.
4. Recomendaciones por perfil
Founder técnico SaaS B2B (típicamente ex-dev, MRR USD 5-50K)
Recomendación: API managed por default, self-host a partir de USD 1-2K/mes de API.
Tu tiempo se paga mejor construyendo features que operando infraestructura. API managed te saca del ring de DevOps ML y te deja enfocar en producto. Si pasás 30M tok/mes y el costo de API te supera USD 1,5K/mes, self-hosting de 70B Q4_K_M para el modelo grande empieza a rendir. Mantené Sonnet 5 / Opus 5 para los prompts chicos donde necesitás calidad frontier.
Founder no técnico (background marketing/operaciones, MRR USD 0-20K)
Recomendación: API managed siempre.
Self-hosting es una trampa si no tenés DevOps dedicado. La diferencia de USD 200-500/mes en API no te cambia el runway, pero 6 meses peleando con llama.cpp te lo cambia. Mantené la nube, pagá lo que cobre, y usá tu tiempo en producto y ventas. Cuando pases USD 5K/mes en API y tengas DevOps interno o presupuesto para contratar uno, reconsiderá.
Fintech / salud / legal (compliance manda)
Recomendación: local u on-prem, sin discusión.
Si procesás datos financieros, clínicos o jurídicos, la nube tiene un costo contractual y regulatorio que no es solo dinero: es tiempo legal, BAA, auditorías, riesgo de breach. Self-hosting no es "más barato" en este caso, es la única opción que cumple. Calculá el break-even en dólares, pero tomá la decisión en compliance. Auditar el stack de IA es requirement del board, no del CTO.
Edtech / contenido / marketing (volumen alto, baja sensibilidad)
Recomendación: API managed barata (DeepSeek V4-Flash, open-weight via gateway).
Tu volumen es alto pero tu data es pública o anonimizable. DeepSeek V4-Flash ($0.27 / $1.10 por 1M) o un gateway open-weight (Together, Fireworks, OpenRouter) te da pricing 5-10× más barato que frontier sin perder calidad significativa en generación de contenido. A 50M tok/mes la diferencia con Claude Opus 5 es USD 3K/mes. No tiene sentido self-hosting para esta carga.
Agencia / consultora (mixto)
Recomendación: API managed + un modelo open-weight local para experimentación interna.
Tu modelo de negocio son proyectos cortos. Cada cliente tiene compliance distinto. API managed te da flexibilidad sin CAPEX. Si querés hacer prototypes rápidos de RAG o fine-tuning sin pagar por experimentación, una workstation local con 32 GB corre modelos 32B Q4_K_M y la depreciás en 12 meses.
Consultor / partner de IA que vende a otros
Recomendación: híbrido completo + el case study es la venta.
Tené self-host en workstation (para validación y demos), API managed (para producción de clientes), y el conocimiento profundo de cuándo cada uno. El case study de arriba es exactamente el tipo de análisis que cerrás deals. Si tu cliente es Latam SaaS y no podés darle números concretos para decidir, perdés el contrato frente a otro consultor que sí. Invertí 1 día en armar el desglose con tus números reales.
5. Cuándo NO usar local (3 anti-patrones)
Anti-patrón 1 — Local con <1M tok/mes. El CAPEX de USD 4,000 se deprecia en 36 meses → USD 1,100/año + USD 80 electricidad = USD 1,180/año, o USD 98/mes. A 1M tok/mes, Sonnet 5 todo input te sale USD 2/mes. La nube es 49× más barata y no necesitás DevOps. Self-hosting tiene sentido solo a partir de 5-30M tok/mes (dependiendo de tu DevOps).
Anti-patrón 2 — Local sin DevOps dedicado. Self-hosting no es "comprar un Mac y listo". Es monitoreo de throughput, actualización de modelos, cuantización, A/B testing, debugging de prompts. Si nadie en tu equipo tiene las 200+ horas de expertisia, vas a pagar consultor externo USD 50-150K/año o vas a perder meses peleando. Sin DevOps, API managed siempre.
Anti-patrón 3 — Local cuando necesitás frontier constantemente actualizado. Open-weight queda 3-12 meses detrás del frontier. Si tu producto vive en el filo de la capacidad (análisis de imágenes médicas, generación de código de producción, agent loops complejos), necesitas acceso al último Sonnet / Opus / GPT-5.6. Self-hosting te ata al modelo que cargaste y migrar es 1-2 semanas de evals + re-tuning. API managed siempre para productos que viven del frontier.
Conclusión
La decisión entre IA local y nube no es binaria. Es una matriz de 5 variables — volumen, sensibilidad, latencia, presupuesto, expertise — que podés evaluar en 20 minutos con el case study de arriba.
Tres preguntas finales antes de decidir:
- ¿Mi volumen va a pasar 30M tok/mes en los próximos 12 meses? Si sí, local rinde. Si no, nube.
- ¿Mi data es sensible bajo regulación explícita (HIPAA, LGPD, AI Act)? Si sí, local u on-prem, sin discusión.
- ¿Mi producto vive del frontier (coding agents, voice, multimodal)? Si sí, API managed.
Si las tres respuestas son tibias (volumen medio, sensibilidad media, sin frontier crítico), un enfoque híbrido — modelos chicos en API, modelos grandes local — suele ganar. Y si querés que valide este cálculo con tus números reales en 20 minutos, reservá una llamada gratis de 30 minutos.
Si tu startup está evaluando self-hosting vs managed API para IA, y querés validar el setup con tu carga real antes de comprometerte a hardware o contratos a 12 meses, reservá una llamada gratis de 30 minutos — solemos poder decirte exacto el break-even con tu workload mix.
Leer también:
- Cuánta RAM necesitás para correr IA local en 2026 — si ya decidiste ir a local, esta es la guía de hardware.
- Modelos chinos open-weight en SaaS: 30-46% del tráfico de gateways LLM en 2026 — qué modelos open-weight están dominando y cómo elegir.
- Grok 4.5 vs Sonnet 5 vs Claude Opus 5: menú de modelos 2026 — comparativa tier alta para cuándo managed API gana sobre self-hosting.
- Cuánto cuesta implementar IA en una startup SaaS en 2026 — el contexto macro de costos.
- Cómo elegir un consultor de IA en 7 preguntas — para validar el setup con ayuda externa.
- Volver al blog — todos los artículos.
Preguntas frecuentes
¿Cuándo conviene usar IA local vs nube?
Depende de 5 variables: volumen de tokens/mes, sensibilidad de los datos, latencia objetivo, presupuesto disponible y expertise técnico del equipo. Como regla de pulgar: si pasás 30M tokens/mes y tu data es sensible (PII, salud, legal), local es 5-20× más barato y te resuelve compliance. Si estás bajo 1M tok/mes y tu data es pública, la nube es 50-200× más barata y te evita DevOps. En el medio, un split (modelos baratos en nube, modelos grandes en local) suele ganar.
¿Cuánto cuesta mantener un LLM local?
El CAPEX mínimo para correr un 70B Q4_K_M con contexto cómodo en 2026 es USD 4,000 (M3 Max 128GB workstation). Electricidad y mantenimiento: USD 80-200/año. Si contratás DevOps para mantenerlo, sumá USD 50-150K/año. Self-hosting en cloud (RunPod, Lambda) corre USD 1.50-2.50/hora → USD 13-22K/año continuous sin DevOps dedicado.
¿Es más barata la IA local que la nube?
Solo a escala. Local puro (sin DevOps): break-even a ~30M tok/mes vs Claude Sonnet 5. Local + DevOps medio: ~15M tok/mes. Bajo ese umbral la nube gana 50-200×. Sumá el costo de oportunidad: si DevOps te cuesta USD 100K/año y la nube te cobra USD 5K/año, el «ahorro» de local es de USD 95K/año solo si el volumen lo justifica.
¿Qué datos NO debería mandar a la nube?
PII identificable (emails, DNI, teléfonos), datos financieros de terceros sin contrato BAA, datos de salud sin HIPAA, código propietario core, secretos comerciales, y datos bajo obligación contractual de residencia local (LGPD Brasil tiene cláusulas de transferencia internacional, Ley 1581 Colombia exige consentimiento explícito para transferencia fuera del país). Para estos casos local u on-prem es la única respuesta razonable.
¿Qué necesito para correr un LLM local en producción?
Tres cosas: (1) hardware (64-128 GB RAM o 24+ GB VRAM GPU, ver guía de RAM), (2) runtime (llama.cpp, ollama, vLLM, o MLX en Apple Silicon), (3) alguien que sepa operarlo. Para producción real también necesitás: monitoring de costos por request, A/B testing contra el modelo de referencia, y un plan de upgrade cuando salga un modelo frontier nuevo. Sin los tres primeros, no es producción: es un demo.