
El menú de modelos de IA en 2026: cuándo usar Sol, Terra, Luna, Grok 4.5, Sonnet 5 y Muse Spark 1.1
Respuesta corta (60 segundos): Entre el 30 de junio y el 15 de julio de 2026 hubo un aluvión de modelos frontier. Siete lanzamientos en nueve días (8-9 jul): Grok 4.5 (xAI), GPT-Live-1 + mini (OpenAI voz full-duplex), GPT-5.6 Sol/Terra/Luna (OpenAI) y Muse Spark 1.1 (Meta). Antes, el 30 jun, Anthropic había lanzado Claude Sonnet 5. La pregunta dejó de ser "OpenAI o Anthropic" — ahora es "¿cuál de los seis+ modelos para qué caso de uso?". Esta es la cheatsheet con pricing, cost-per-task, y las caveats que cambian tu routing matrix (EU availability, retención 30 días de Anthropic, intro pricing de Sonnet 5 que vence, tokenizer nuevo de Claude).
El menú frontier de julio de 2026 cabe en una sola página — y eso es lo que vuelve este momento raro. Cinco labs (Anthropic, OpenAI, xAI, Meta, y en off-topic Google todavía sin release) movieron el catálogo en menos de un mes. Cada vez que mirabas una tabla, una celda cambiaba.
Para SaaS founders y CTOs la decisión ya no es "qué proveedor" — es "qué modelo de qué proveedor para qué workload". El sticker price dejó de ser suficiente: en coding agent, GPT-5.6 Luna cuesta ~USD 0.21 por tarea en el Artificial Analysis Coding Agent Index; Claude Fable 5 cuesta ~USD 11.80 — 56x por la misma tarea. Si no estás rutando por costo-por-tarea, estás pagando la factura del lab que no te conviene.
Esta es la cheatsheet que tenía en mi Notion, ordenada para que la abras cuando tengas que decidir. Una tabla con todo, después un párrafo por modelo con lo que importa, y al final las reglas de routing que aplico con clientes.
La tabla: los siete modelos nuevos del ciclo
| Modelo | Maker | Lanzado | Pricing (in/out por 1M tok) | Mejor para |
|---|---|---|---|---|
| Grok 4.5 | xAI | 8 jul | $2 / $6 | Coding agents, Cursor, latencia baja |
| GPT-Live-1 | OpenAI | 8 jul | n/d (sólo ChatGPT pago) | Voz full-duplex, voice UX |
| GPT-Live-1 mini | OpenAI | 8 jul | n/d (sólo ChatGPT free) | Voz full-duplex en free tier |
| GPT-5.6 Sol | OpenAI | 9 jul | $5 / $30 | Frontier agentic, tareas largas multi-step |
| GPT-5.6 Terra | OpenAI | 9 jul | $2.50 / $15 | Mid-tier, GPT-5.5 quality a mitad de costo |
| GPT-5.6 Luna | OpenAI | 9 jul | $1 / $6 | Volumen, agents de bajo costo, free tier |
| Claude Sonnet 5 | Anthropic | 30 jun | $2 / $10 intro* → $3/$15 | Agentes Anthropic, drafting |
| Muse Spark 1.1 | Meta | 9 jul | $1.25 / $4.25 | Agentic multimodal, output-heavy |
*Pricing intro de Sonnet 5 vigente hasta el 31 de agosto de 2026.
Fuentes verificadas: xAI, OpenAI API pricing, Anthropic, Meta AI, OpenAI GPT-Live. Listado compilado por Capital & Compute.
El cuadro que importa: costo-por-tarea, no por token
El sticker price engaña. Lo que cambia tu factura es lo que te cuesta una tarea terminada, multiplicando el consumo real de tokens por la tasa del modelo. En el Artificial Analysis Coding Agent Index, una tarea típica de coding agentic te sale:
| Modelo | Costo por tarea (AA Coding Agent Index) | Tier |
|---|---|---|
| GPT-5.6 Luna | ~$0.21 | Más barato |
| GPT-5.6 Terra | ~$0.55 | Barato |
| GPT-5.6 Sol | ~$1.04 | Mid |
| Grok 4.5 | ~$2.49 | Mid-alto |
| GPT-5.5 (anterior) | ~$5.07 | Caro |
| Claude Fable 5 | ~$11.80 | Frontier top |
La diferencia entre el más barato y el más caro es ~56x para la misma tarea de coding agent. Esto es el argumento central para rutear en vez de elegir un solo modelo.
Por modelo: lo que importa de cada uno
Claude Sonnet 5 (Anthropic, 30 jun)
El mid-tier de Anthropic, lanzado como el "default" para agentes corriendo en Claude Code. Pricing intro $2 input / $10 output por 1M tokens hasta el 31 de agosto de 2026; después salta a $3 / $15. Contexto 1M tokens, output máximo 128k.
Lo que destaca: el pricing intro es una ventana de un mes y medio para correr evals propias. Si estás sobre Anthropic SDK, no hay razón para cambiar ahora — capturá el descuento. Caveat importante: Sonnet 5 usa un tokenizer nuevo que produce ~30% más tokens para el mismo texto, así que el list price sobre subestima el costo real comparándolo byte-a-byte con GPT-5.6.
GPT-5.6 Sol (OpenAI, 9 jul — flagship)
$5 input / $30 output por 1M tokens. El flagship del relanzamiento de la familia 5.6. Tiene modo ultra (subagentes paralelos), modo max (esfuerzo de razonamiento al techo), y Programmatic Tool Calling en GA.
Lo que destaca: lidera el AA Coding Agent Index (80 vs Fable 5 en 77.2) y "Agents' Last Exam" (53.6 vs Fable 5 en 40.5). En SWE-Bench Pro va detrás de Fable 5: 64.6% vs 80.4%. Es el modelo a elegir para tareas largas agentic donde necesitás coordinación sostenida. Caveat: el modo ultra gasta muchos más tokens por tarea — está en la columna de "quality-escalation", nunca en "ahorro".
GPT-5.6 Terra (OpenAI, 9 jul — mid)
$2.50 / $15 por 1M tokens. Posicionado por OpenAI como "GPT-5.5 quality a la mitad del precio". Disponible en Codex y la API.
Lo que destaca: el sweet spot del menú. Si tu workload es drafting de documentos largos, generación de código de aplicación no-extremo, o knowledge work donde Fable 5 es overkill, Terra es la opción de costo balanceado. En el AA Coding Agent Index sale $0.55 por tarea — la mitad de Sol con calidad comparable en la mayoría de workloads de marketing y back-office. Si tenías GPT-5.5 integrado, esta es la migración obvia.
GPT-5.6 Luna (OpenAI, 9 jul — volumen)
$1 input / $6 output por 1M tokens. El tier de volumen de la familia, disponible en free tier además de planes pagos.
Lo que destaca: el más barato por sticker. En el AA Coding Agent Index sale ~$0.21 por tarea — el piso del mercado. Caveat: la misma tarea que en Luna te sale $0.21, en Muse Spark te puede salir menos si la carga es output-heavy (Luna cobra $6 output, Muse Spark $4.25). Para workloads donde el input domina (clasificación, extracción, RAG retrieval scoring), Luna es la decisión correcta. Para loops agentic con mucho output, Muse Spark 1.1 gana por debajo.
Grok 4.5 (xAI, 8 jul)
$2 input / $6 output por 1M tokens. Contexto 500K, salida ~80 tokens/segundo, co-entrenado con Cursor en trazas de agent loops.
Lo que destaca: el sticker de frontier más barato combinado con latencia deCursor-style. Si tu IDE es Cursor, Grok 4.5 está tuneado al loop exacto que corrés todos los días. Artificial Analysis lo mide en el cuarto lugar del Intelligence Index (54, detrás de Fable 5 en 60, Opus 4.8 en 56 y GPT-5.5 en 55). Caveat: todavía no disponible en la UE. Si tu equipo está en Europa, esperá hasta mid-julio (fechas de xAI) o usá Cursor con otra familia mientras tanto.
Muse Spark 1.1 (Meta, 9 jul)
$1.25 input / $4.25 output por 1M tokens. Contexto 1M. Primer modelo pago de Meta (hasta ahora todo su trabajo era open-weights). US-only preview por ahora, con créditos gratis al arranque.
Lo que destaca: la sorpresa del ciclo. Su output rate ($4.25/M) undercut a GPT-5.6 Luna ($6) y Claude Haiku 4.5 ($5), que es donde está el ahorro real para agentic loops output-heavy. Lidera los tool-use evals que Meta publicó, pero va detrás de los frontier en coding puro — los números son vendor-reported, no auditados independientemente todavía. Caveat: US-only preview limita adoptadores globales; la capacidad parece ajustada al arranque (lanzamiento con créditos gratis lo sugiere).
GPT-Live-1 y GPT-Live-1 mini (OpenAI, 8 jul)
Modelos de voz full-duplex lanzados el 8 de julio. GPT-Live-1 es el default nuevo para ChatGPT Voice en planes pagos, GPT-Live-1 mini para free tier. Sin pricing de API publicado todavía — OpenAI tiene un formulario de signup para notificación.
Lo que destaca: full-duplex significa que el modelo escucha y habla al mismo tiempo. Podés interrumpirlo como una conversación humana, hace live translation, no hay turno explícito. Si estás construyendo voice UX en 2026 (atención al cliente por voz, voice-enabled agents, accesibilidad), este es el cambio más relevante del mes aunque todavía no esté accesible vía API. Caveat: la latencia y calidad en español latino específicamente todavía no están medidas independientemente — es donde Latino America SaaS suele encontrar fricciones.
Cuándo elegir cada uno (reglas de routing)
Estas son las reglas que uso con clientes cuando armo una matriz de routing. No son las únicas correctas — son las que mejor resultado me han dado sobre workloads reales de SaaS.
Default coding workhorse → GPT-5.6 Terra. Capacidades de GPT-5.5 a la mitad del precio ($2.50/$15). Cubre el 80% de los workloads de coding en producción sin necesidad de frontier.
Hardest tasks, price no object → GPT-5.6 Sol (max o ultra). Si tu carga es multi-step agentic, sessions de horas con tool use sostenido, o reasoning sobre bases de código grandes. Aceptás el sticker $5/$30 porque el costo-por-tarea sigue siendo competitivo.
High-volume agents output-heavy → Muse Spark 1.1 (si estás en US) o GPT-5.6 Luna (global). Si tu loop agentic genera mucho output, Muse Spark a $4.25/M te undercut a Luna en $6/M. Si tu loop es input-heavy (RAG retrieval, classification), Luna a $1/M input es el piso.
Cursor users → Grok 4.5. El co-training con Cursor significa que el modelo está optimizado para el loop exacto de Cursor. Probá un sprint de side-by-side — muchas veces la diferencia se nota en latencia, no en output.
Anthropic stack → Claude Sonnet 5 antes del 31 de agosto. Si tu codebase ya corre en Anthropic SDK, no migres por migrar. Capturá el discount intro $2/$10, corré las evals propias, después decidís.
Voice UX → GPT-Live-1. Aunque sea sólo vía ChatGPT por ahora, el cambio cualitativo de half-duplex a full-duplex redefine UX de voz. Esperá la API pública pero empezá a diseñarla.
Las cuatro asterisks que cambian tu matriz
El menú se ve limpio en la tabla. En producción hay cuatro hechos que cambian la decisión para equipos específicos:
-
EU availability de Grok 4.5. Todavía no disponible en la UE. Si tu equipo corre en Europa, todos los "Grok 4.5" de la matriz de arriba llevan asterisco. xAI apunta a mid-julio de 2026 — revisalo antes de comprometerte.
-
Retención de datos de Mythos/Fable 5. Anthropic aplica retención obligatoria de 30 días en los modelos Mythos-class (que incluye Fable 5), y los Zero Data Retention agreements no los cubren. Si pasás drafts de estrategia con clientes o material no publicado por ahí, esto es un input de routing por sí solo.
-
Sonnet 5 intro pricing vence el 31 de agosto. El descuento intro $2/$10 (33% debajo de tarifa standard) es una ventana de evaluación. Desde el 1 de septiembre salta a $3/$15. Si tu plan es mover algo significativo a Sonnet 5, el momento es ahora.
-
Tokenizer nuevo de Claude. Anthropic confirmó que Sonnet 5 usa un tokenizer que produce ~30% más tokens para el mismo texto. La comparación "$/MTok" contra GPT-5.6 subestima el costo real de Claude a igual volumen de texto. Multiplicá por 1.3 antes de comparar.
El ángulo LATAM: lo que cambia para vos
Tres observaciones desde Buenos Aires, no desde San Francisco:
-
Pricing en USD sin variación regional. OpenAI, Anthropic y xAI cobran lo mismo en Buenos Aires que en California. Meta tampoco diferencia. Esto te nivela el playing field contra competidores basados en US para el costo del API en sí — la diferencia la hacés en cómo lo usás, no en cuánto pagás por token.
-
Data residency sí importa. Fable 5 / Mythos 5 con retención 30 días no es opción si manejás datos de clientes que contractualmente requieren procesamiento local o no-retention. Para esos casos, Grok 4.5 (con caveat de EU), Muse Spark (US-only), o GPT-5.6 tier bajo (Luna) con data agreements apropiados son alternativas. OpenAI ofrece Zero Data Retention como opción en API enterprise — revisalo caso por caso.
-
Spanish latino y LATAM-specific evals. Ninguno de estos modelos fue medido independientemente en workloads de español rioplatense específico (legal argentino, contratos comerciales mexicanos, normativa chilena). Antes de comprometer una migración grande, corré evals con tus prompts reales — el modelo "mejor en benchmarks" no necesariamente es el mejor para tu caso regional.
¿Querés discutir cuál de los seis+ tiene sentido para tu workload antes de cambiar de modelo o migrar código? Hay un CTA al final con una llamada gratis de 30 minutos.
Preguntas frecuentes (resumidas)
¿Qué es lo más importante que cambió en julio 2026? Siete modelos en nueve días, de cuatro labs distintos, con precios que se solapan en tiers donde antes no había solapamiento.
¿Cuál es el más barato? GPT-5.6 Luna ($1/$6 MTok). En costo-por-tarea, también Luna (~$0.21).
¿Cuál es el mejor para coding agent sostenido? GPT-5.6 Sol lidera el AA Coding Agent Index; Claude Fable 5 lidera SWE-Bench Pro. Para coding sostenido, Sol — el sticker es más barato y la diferencia es chica.
¿Sonnet 5 sigue siendo relevante después de GPT-5.6? Sí, sobre todo si tu stack ya está sobre Anthropic. Capturá el intro pricing antes del 31 de agosto.
¿Por qué Muse Spark es interesante si va detrás en coding? El output rate undercut a Luna y Haiku — clave para agent loops output-heavy. Y Meta siendo Meta, los próximos releases pueden cerrar la brecha rápido.
¿Y Gemini? Google no liberó nada nuevo en julio. Gemini 3.5 Pro está "coming soon" sin fecha. Vale la pena mirarlo cuando aparezca.
Preguntas frecuentes
¿Qué cambió en el menú de modelos de IA en julio de 2026?
En nueve días (8 y 9 de julio) salieron siete modelos nuevos de cuatro labs: Grok 4.5 (xAI), GPT-Live voz full-duplex (OpenAI), GPT-5.6 Sol/Terra/Luna (OpenAI), Muse Spark 1.1 (Meta). Antes ya estaba Sonnet 5 (Anthropic, 30 jun). El menú frontier pasó de "elegir entre dos labs" a "elegir entre seis+ modelos según el caso de uso y el presupuesto por tarea".
¿Cuál es el modelo más barato por tarea en julio de 2026?
Por sticker price, GPT-5.6 Luna ($1 input / $6 output por 1M tokens). Por costo real por tarea terminada en el Artificial Analysis Coding Agent Index, GPT-5.6 Luna completa una tarea de coding agent por ~USD 0.21. Grok 4.5 cuesta ~$2.49 por tarea — su sticker barato ($2/$6) se ve compensado por más tokens de output que Luna en coding agentic.
¿Cuándo conviene Grok 4.5 sobre los demás?
Grok 4.5 fue co-entrenado con Cursor en trazas de agent loops, servido a ~80 tokens/segundo, $2/$6 MTok, 500K context. Te conviene si tu IDE es Cursor, si necesitás latencia de respuesta baja para UI en tiempo real, o si querés el sticker de frontier más barato. Cuidado: todavía no está disponible en la UE.
¿GPT-5.6 Sol o Claude Fable 5 para coding agent?
No hay campeón único. En la tabla GA de OpenAI, Claude Fable 5 lidera SWE-Bench Pro (80% vs Sol 64.6%) y el GDPval-AA Elo. Sol lidera el AA Coding Agent Index (80 vs 77.2) y "Agents' Last Exam" (53.6 vs 40.5). En trabajo real la diferencia es chica y el costo por tarea difiere ~10x: Sol ~$1.04, Fable 5 ~$11.80. Para coding agent sostenido, Sol es el sweet spot actual; para razonamiento sostenido y casos edge, Fable 5.
¿Qué tiene de especial Muse Spark 1.1?
Es el primer modelo pago de Meta. $1.25 input / $4.25 output por 1M tokens, 1M context, foco agentic + multimodal, US-only preview por ahora. Su output rate ($4.25) undercut a GPT-5.6 Luna ($6) y Claude Haiku 4.5 ($5), que es donde está el ahorro real para workloads agentic output-heavy.
¿Claude Sonnet 5 o los nuevos GPT-5.6?
Sonnet 5 sigue siendo la opción obvia si tu stack ya está sobre Anthropic: $2/$10 intro pricing hasta el 31 de agosto, 1M context, el mismo SDK que ya usás. La alternativa Terra ($2.50/$15) tiene calidad GPT-5.5 a la mitad del precio de GPT-5.5 — comparable en borrador de marketing o documentos largos. Si tu workload es agente coding on Claude Code, quedate con Sonnet 5 hasta agosto para capturar el descuento.
¿Y qué es GPT-Live y por qué importa?
GPT-Live-1 y GPT-Live-1 mini son los modelos de voz full-duplex de OpenAI lanzados el 8 de julio: el modelo escucha y habla a la vez, podés interrumpirlo naturalmente y hace live translation. GPT-Live-1 se vuelve el default de ChatGPT Voice para planes pagos, el mini para usuarios free. Sin pricing de API publicado todavía. Si estás construyendo voice UX en 2026, es el cambio más relevante del mes.