
GPT-5.6 Luna a $0.20/$1.20 por millón de tokens: cómo recalcular tu cost model SaaS en 2026
Respuesta corta (60 segundos): OpenAI bajó GPT-5.6 Luna a $0.20 input / $1.20 output por millón de tokens en julio 2026, una reducción del ~96% vs GPT-5.6 Sol. Para un SaaS LATAM con un agente de soporte en español a 10K tickets/mes, eso baja la factura de USD 50/mes (GPT-4o) a USD 3.30/mes (Luna). La estrategia correcta no es "todo a Luna" sino routing tiered: Sol para premium, Terra para medio, Luna para volumen. Si tu costo mensual con OpenAI pasó los USD 5K, te conviene migrar parte del tráfico a Luna esta semana, no el próximo trimestre.
El 30 de julio de 2026, OpenAI bajó GPT-5.6 Luna a $0.20/$1.20 por millón de tokens. Es el corte de pricing más agresivo desde GPT-4o-mini y cambia la fórmula para cualquier SaaS que hojea un invoice de OpenAI cada mes. Este post es lo que cambia, cuánto ahorrás en la práctica, y cuándo conviene seguir en Sol o cambiar de provider.
Pricing oficial, agosto 2026 (USD por 1M tokens)
| Modelo | Input | Output | Posicionamiento |
|---|---|---|---|
| GPT-5.6 Sol | 5.00 | 30.00 | Razonamiento premium, código complejo, generación creativa |
| GPT-5.6 Terra | 2.00 | 12.00 | Rango medio, default para mayoría de casos |
| GPT-5.6 Luna | 0.20 | 1.20 | Volumen, clasificación, agents entry-level |
Lectura rápida: Luna es 25x más barato en input y 25x más barato en output que Sol. La pregunta no es si Luna es bueno — es dónde perdés calidad al usarlo. La respuesta corta: tareas estructuradas no perdés nada significativo, tareas creativas largas sí.
Ejemplo real: agente de soporte en español a 10K tickets/mes
Mismo caso que usé en el post de Claude vs ChatGPT, así podés comparar manzanas con manzanas.
Tokens promedio por ticket (español, soporte SaaS):
- Input (system prompt + ticket): 1,100 tokens
- Output (clasificación + respuesta): 420 tokens
A 10K tickets/mes:
| Modelo | Costo input | Costo output | Total/mes |
|---|---|---|---|
| GPT-5.6 Sol | 11,000 × $5/1M = $55 | 4,200 × $30/1M = $126 | $181/mes |
| GPT-5.6 Terra | 11,000 × $2/1M = $22 | 4,200 × $12/1M = $50.4 | $72.4/mes |
| GPT-5.6 Luna | 11,000 × $0.20/1M = $2.20 | 4,200 × $1.20/1M = $5.04 | $7.24/mes |
(Comparación con GPT-4o y GPT-4o-mini del post de Claude vs ChatGPT: $69.50/mes y $4.17/mes respectivamente.)
Lectura: migrar de Sol a Luna baja tu factura de $181 a $7.24/mes — un 96% de ahorro. Pero Sol probablemente te daba mejor calidad para tickets ambiguos. La decisión real es routing tiered:
- Tickets de billing / FAQ / reset password → Luna. No necesitás razonamiento.
- Tickets ambiguos / escalaciones / edge cases → Sol o Terra. Acá la calidad importa.
A 10K tickets/mes, con 80% ruteado a Luna y 20% a Sol: $7.24 × 0.8 + $181 × 0.2 = $42/mes. Vs todo a Sol: $181. Ahorro: $139/mes, 77% menos.
Cuándo NO migrar a Luna
Luna no es la respuesta para todo. Estos casos se quedan en Sol o Terra:
- Razonamiento multi-paso y agents complejos. Un agent que toma 5-10 decisiones encadenadas (investigar, decidir, ejecutar, verificar) baja la calidad en Luna. Cada paso pierde ~10-15% de accuracy, compuesto.
- Generación creativa o de código de alta calidad. Copy de marketing, whitepapers, código refactor crítico. Acá la diferencia de calidad se nota.
- Análisis de documentos largos y ambigüos. Donde la comprensión sutil del contexto cambia la respuesta correcta.
- Casos donde el costo de error es alto. Legal, médico, financiero. La diferencia entre 4% y 6% de error se traduce en revenue perdido.
La regla práctica: si tu UI muestra la respuesta al usuario final y la calidad es core al producto, no bajes de Terra. Si la respuesta es un JSON intermedio en un pipeline, Luna alcanza.
Cómo hacer la migración sin romper nada
- Auditá tu tráfico por tipo de tarea. Separá lo que es "razonamiento crítico" de lo que es "transformación / extracción". Para la mayoría de SaaS, el 70-80% cae en la segunda categoría.
- Implementá routing por tier. No es un flag único — es una decisión por endpoint. Algunos frameworks (LangGraph, Vercel AI SDK, Hermes Agent) lo tienen nativo. Otros requieren un wrapper casero de 30 líneas.
- Migrá el tráfico de bajo riesgo primero. Clasificación, embeddings, resúmenes. Dejá el último migration para los flujos donde falla la calidad.
- Medí calidad con un eval suite. No migres a ciegas. 5-10 prompts representativos de tu producto, corrélos en Luna y Sol, compará. La diferencia debería ser medible en tu caso, no en benchmarks genéricos.
- Mantené un fallback a Sol. Si Luna se cae o degrada, el routing cae automáticamente a Sol. El costo de mantener fallback es bajo y el costo de no tenerlo es un outage.
Cuándo conviene Gemini 3.7 Flash o Claude Sonnet 5 en lugar de Luna
Luna es el default para SaaS OpenAI-céntricos. Pero hay casos donde mirar afuera:
- GCP nativo / BigQuery / Vertex AI. Si tu stack vive en Google Cloud, Gemini 3.7 Flash via Vertex AI te da billing consolidado, data residency y ~50% descuento en coding workloads hasta fin de 2026.
- Tier gratis para MVP. Gemini tiene el tier gratis más generoso del mercado. Si estás armando un MVP y no querés pagar nada, Gemini es la única opción decente.
- Compliance con AWS Bedrock. Si tu cliente enterprise requiere que el LLM corra en su cuenta de AWS, Claude Sonnet 5 via Bedrock es la respuesta. Luna no está en Bedrock.
- Mejor escritura en español. Si tu producto compite en copy o tono de marca, Claude Sonnet 5 todavía tiene la reputación. La diferencia es sutil — no la asumas, hacé un A/B con tus prompts.
La mayoría de SaaS LATAM no encajan en estos casos. Luna es el default correcto.
Tres optimizaciones que aplican con Luna
- Cacheá prompts determinísticos. Hash de (system prompt, user input) → Redis. Hit rates típicos 30-60%. Con Luna el impacto absoluto es menor, pero el % sigue siendo 30-60%.
- Batching. Acumulá requests no urgentes y mandalas juntas. OpenAI da 50% descuento en Batch API. Funciona perfecto para resúmenes nocturnos, reportes, processing de logs.
max_tokenspor endpoint. Un usuario hace una pregunta y espera 2-3 oraciones. No le des 800 tokens.max_tokens: 200corta sin perder UX.
Lo que cambia para tu cost model
Si tu SaaS estaba pagando $5K-$30K/mes en OpenAI, Luna te deja mover parte significativa a tier de costo bajo. La migración no es "cambiar un flag", es un proyecto de routing que te lleva 1-2 semanas. El retorno es inmediato: en el primer invoice ya ves el cambio.
Una advertencia honesta: si tu SaaS está pagando $500/mes, no te obsesiones con Luna. Tu problema de margen está en otra parte (costo de adquisición, churn, ARPU). Migrar a Luna te ahorra $40/mes — no cambia el unit economics.
Hablemos de tu caso
Si querés validar cuánto ahorrarías migrando a GPT-5.6 Luna con tus prompts reales, reservá una llamada de 30 minutos sin costo. En 20 minutos sueldo poder darte un rango con números más cercanos a tu caso.
Leer también:
- Claude vs ChatGPT API: cuánto cuesta cada respuesta en español 2026 — comparativa tier-by-tier con Claude.
- Integrar OpenAI sin reventar costos — las 6 prácticas para que la factura no se dispare.
- Cuánto cuesta implementar IA en una startup SaaS — presupuesto del proyecto completo.
- Más artículos sobre IA para founders — guías y comparativas.
- Volver al blog — todos los artículos.
Preguntas frecuentes
¿Cuánto cuesta GPT-5.6 Luna en agosto 2026?
$0.20 USD por millón de tokens de input y $1.20 USD por millón de tokens de output, según OpenAI. Es una reducción del ~96% vs GPT-5.6 Sol ($5/$30) y del ~90% vs GPT-5.6 Terra ($2/$12). ChatGPT la usa como modelo default en plan Free con chats ilimitados desde el 30 de julio de 2026. La API está abierta para todos los tiers de uso.
¿Cuándo conviene migrar de GPT-5.6 Sol a Luna?
Cuando el caso de uso tolere menor calidad de razonamiento y la prioridad sea volumen / costo. Luna gana en: clasificación, extracción, resúmenes cortos, autocompletar, agents entry-level, chatbots de soporte con guion definido. Luna pierde en: razonamiento multi-paso, generación creativa larga, código complejo, tareas donde la diferencia de calidad se traduce en revenue perdido. La estrategia correcta es tiered: Sol para premium, Luna para el resto.
¿Cuánto ahorra un SaaS LATAM con GPT-5.6 Luna?
Para un agente de soporte en español a 10K tickets/mes, pasás de pagar USD 50/mes con GPT-4o a USD 4.17/mes con GPT-4o-mini, y la migración a GPT-5.6 Luna baja eso a ~USD 3.30/mes. A 100K tickets/mes, la diferencia es USD 500/mes vs USD 33/mes. El ahorro solo en tier de soporte paga un dev junior en LATAM. Sumale el resto de llamadas (resúmenes, embeddings, agents) y el ahorro es más significativo.
¿Luna reemplaza a GPT-4o-mini?
Sí, en la mayoría de casos. GPT-5.6 Luna tiene pricing similar pero mejor calidad en benchmarks de razonamiento y código. Si tu SaaS corría sobre GPT-4o-mini, migrar a Luna es un upgrade neto. Si corría sobre GPT-4o (no mini), evaluá primero con tus prompts reales — la pérdida de calidad en tareas complejas puede no justificar el ahorro.
¿Cuándo conviene Gemini 3.7 Flash o Claude Sonnet 5 en lugar de Luna?
Gemini 3.7 Flash cuando necesitás tier gratis generoso, integraciones nativas con Google Cloud (BigQuery, VertexAI), o estás armando un MVP que no aguanta pagar API. Claude Sonnet 5 cuando necesitás mejor escritura en español, respeto estricto a instrucciones largas, o compliance con AWS Bedrock / GCP Vertex AI. Para SaaS LATAM que ya corre OpenAI, Luna es el default; los otros son para casos puntuales.
¿Qué pasa con el overhead de tokenización en español?
Igual que GPT-4o, Luna consume 30-50% más tokens en español que en inglés para el mismo significado. Eso multiplica tu factura por 1.3-1.5x y no es un descuento que OpenAI te vaya a dar. La estrategia: si tu producto sirve principalmente español, presupuesto tus estimaciones sobre benchmarks en inglés × 1.4 y vas a estar más cerca de la factura real.