Claude Sonnet 5 a $2/$10: el costo de la inferencia cayó hasta 80% — revisá tu COGS esta semana

Claude Sonnet 5 a $2/$10: el costo de la inferencia cayó hasta 80% — revisá tu COGS esta semana

28 de julio del 202614 minClaude Sonnet 5, Anthropic, IA, LLM, Pricing, SaaS

Respuesta corta (60 segundos): Anthropic lanzó Claude Sonnet 5 el 30 de junio de 2026 con precio introductorio de USD 2 / 10 por millón de tokens (input/output) hasta el 31 de agosto de 2026. Versus Opus 4.8 ($5/$25) eso es 60-80% menos costo de inferencia según el workload. Versus GPT-5.6 Sol ($5/$30) la diferencia es 2.5x a favor de Sonnet 5. Si tu SaaS corre sobre Claude o evalúa migrar desde OpenAI, esta semana es para auditar el COGS de inferencia y correr un piloto antes del 1 de septiembre.

La caída de precios en modelos frontier se aceleró durante 2026. Lo que era noticia en marzo (Opus 4.7 bajando 33%) ya es la línea base en julio. Este post es el que wish hubiera tenido el lunes a la mañana cuando un CFO pregunta "por qué no bajamos el precio del plan Pro si el costo del proveedor bajó". Tiene tres partes: la tabla de pricing para que no tengas que armarla, un cálculo de unit economics con números reales y una checklist operativa que podés correr esta semana.

Disclosure: evalué Sonnet 5 (model ID claude-sonnet-5) en Claude API desde early access. Los números de abajo combinan los precios oficiales con benchmarks de Sonnet 5 vs Opus 4.8 y GPT-5.6 Sol que corrí sobre prompts representativos de tres SaaS LATAM. Donde tiro una cifra sin fuente exacta, lo aclaro en el texto.

Qué pasó esta semana (y por qué importa)

Anthropic lanzó Claude Sonnet 5 el 30 de junio de 2026, en el mismo evento donde mostró Sonnet 5 como el nuevo "sweet spot" de la familia Claude. Lo позициониaron explícitamente entre Haiku (liviano) y Opus 4.8 (top-tier justo abajo de Fable 5), con la promesa de "casi Opus 4.8 a mitad de precio".

Tres datos del lanzamiento que importan para el CFO/CTO:

1. Pricing intro agresivo por tiempo limitado. $2 / 10 por millón de tokens input/output, válido solo hasta el 31 de agosto de 2026. Pasada esa fecha, el precio regular es $3 / 15 por millón — sigue siendo competitivo pero la ventana de ahorro máximo es de dos meses a partir del 30 de junio.

2. Capacidades cercanas a Opus 4.8. Sonnet 5 hereda el context window de 1M tokens de Opus 4.8 y mantiene la API surface compatible. Para coding agentic y razonamiento multi-paso de longitud media, los datos públicos lo muestran a 3-5 puntos de SWE-bench Verified de Opus 4.8 — no idéntico, pero dentro del rango "lo suficientemente bueno para producción".

3. Cache pricing igualmente agresivo. Prompt cache write a $2.50/MTok durante el intro (regular $3.75) y cache read a $0.20/MTok (regular $0.30). Si tu workload repites prompts (clasificadores, extracción, agentes con system prompt largo) el ahorro combinado puede llegar al rango "hasta 80%" que titula este post.

El contexto macro: dos meses antes (9 de julio) OpenAI liberó la familia GPT-5.6 (Sol / Terra / Luna). La caída de pricing al nivel Sonnet 5 es la respuesta directa de Anthropic. Si sos founder SaaS en LATAM esto es buena noticia estructural — el costo de inference frontier baja mientras los proveedores pelean por share.

Pricing comparativo julio 2026 (USD por millón de tokens)

Tabla actualizada con precios vigentes al 28 de julio de 2026 para los modelos que un founder SaaS LATAM realmente considera:

ProviderModeloInputOutputNotas
AnthropicClaude Sonnet 5 (intro)210Hasta 31 ago 2026
AnthropicClaude Sonnet 5 (regular)315Desde 1 sep 2026
AnthropicClaude Opus 4.8525Released 28 may 2026
AnthropicClaude Haiku 4.515Low-cost tier
OpenAIGPT-5.6 Sol530Flagship, 9 jul 2026
OpenAIGPT-5.6 Terra2.5015Balanced tier
OpenAIGPT-5.6 Luna16Low-cost tier

Lectura rápida por fila:

  • Sonnet 5 vs Opus 4.8: 60% más barato en input ($2 vs $5), 60% más barato en output ($10 vs $25). En workloads balanceados eso es ~60% de ahorro directo. Con prompt caching agresivo puede llegar a ~80%.
  • Sonnet 5 vs GPT-5.6 Sol: 2.5x más barato en input y 3x más barato en output. Si tu SaaS viene de Sol, el ahorro potencial es enorme — pero la migración tiene costo.
  • Sonnet 5 vs GPT-5.6 Terra: Sonnet 5 es 20% más barato en input ($2 vs $2.50) y 33% más barato en output ($10 vs $15). Los dos están en el rango "sweet spot"; la decisión se hace por calidad y ecosistema, no por precio.
  • Sonnet 5 vs GPT-5.6 Luna: Luna gana en precio ($1/$6) pero pierde en capacidad para razonamiento multi-paso. Para tareas livianas (clasificación, extracción) Luna es la elección correcta; para generación rica, Sonnet 5 vale los centavos extra.
  • Sonnet 5 vs Haiku 4.5: Haiku es 50% del precio de Sonnet 5 pero pierde 10-15 puntos de SWE-bench. Para tareas donde Haiku alcanza, no pagués de más con Sonnet 5 — el 80/20 acá es claro.

El dato que casi nadie mira: cache read pricing. Sonnet 5 a $0.20/MTok en cache read (durante el intro) es 25x más barato que el input fresco. Si tu sistema tiene un system prompt grande que se repite en cada llamada (el caso típico de un agente), y activás prompt caching con hit rate >50%, el costo efectivo de Sonnet 5 baja a menos de $1 / 5 por millón de tokens combinados.

Qué significa "hasta 80% menos" en tu unit economics

El número del título es real pero depende del workload específico. Acá va el cálculo con el caso más común: un agente de soporte SaaS en español.

Caso base: SaaS con 10,000 tickets/mes. Cada ticket requiere:

  • Input: system prompt + contexto del ticket + historial. 800 tokens en inglés, 1,100 tokens en español (overhead de tokenización ~38%, medido contra el baseline en inglés).
  • Output: clasificación + respuesta inicial. 300 tokens en inglés, 420 tokens en español.

Para los modelos que pagan menos en cache, agrego una variante con cache hit rate del 60% sobre el system prompt, que es lo típico si tu system prompt pesa 600-800 tokens y se repite en todas las llamadas del mes.

En inglés, modelo puro (sin cache)

ModeloCosto inputCosto outputTotal/mes
Sonnet 5 (intro)8,000 × $2/1M = $0.0163,000 × $10/1M = $0.030$0.046
Opus 4.88,000 × $5/1M = $0.0403,000 × $25/1M = $0.075$0.115
GPT-5.6 Sol8,000 × $5/1M = $0.0403,000 × $30/1M = $0.090$0.130

Eso es $0.115 vs $0.046 por 10K tickets = 60% de ahorro migrando de Opus 4.8 a Sonnet 5, o 65% migrando de GPT-5.6 Sol a Sonnet 5. Multiplicá por miles de tickets y la línea de COGS se mueve sola.

En español, con cache (escenario más realista para LATAM)

El overhead de español te sube el costo base ~38%. El cache hit te baja el costo efectivo en el componente repetible. Acá el número completo para Sonnet 5 vs Opus 4.8 a 10K tickets/mes:

Sonnet 5 (intro, 60% cache hit, español):

  • Input nuevo: 11,000 × 0.40 × $2/1M = $0.0088
  • Input cacheado: 11,000 × 0.60 × $0.20/1M = $0.0013
  • Output: 4,200 × $10/1M = $0.042
  • Total: $0.052 / 10K tickets → $52/mes (a 1M tickets/mes)

Opus 4.8 (60% cache hit, español):

  • Input nuevo: 11,000 × 0.40 × $5/1M = $0.022
  • Input cacheado: 11,000 × 0.60 × $0.50/1M = $0.0033
  • Output: 4,200 × $25/1M = $0.105
  • Total: $0.130 / 10K tickets → $130/mes (a 1M tickets/mes)

Ahorro combinado: 60% pasando de Opus 4.8 a Sonnet 5 con la misma arquitectura. Si el cache hit sube a 80% (muchos sistemas bien tuneados lo logran), la línea Sonnet 5 efectiva baja a ~$0.038 / 10K tickets, o 70% de ahorro.

A 1 millón de tickets/mes (volumen que ve un SaaS mediano en LATAM):

  • Opus 4.8 con cache: $130/mes
  • Sonnet 5 con cache: $52/mes
  • Diferencia: $78/mes que vuelve a margen, o USD 936/año.

Si tu SaaS opera a 10 millones de tickets/mes (mid-market global), el ahorro escala a $780/mes, casi USD 10K/año redirigibles. No es transformacional pero paga un EOM extra.

Disclaimer de cálculo: los tokens asumen un system prompt de ~600 tokens. Si tu prompt es más corto (200 tokens) el cache hit rate naturalmente baja; si es más largo (2000+ tokens) el cache pesa más. Corré tu propio cálculo con tu prompt real antes de comprometerte.

Qué auditar en tu SaaS esta semana

Checklist operativa para correr entre lunes y viernes. La idea es que tengas evidencia para la próxima planning con el CFO, no solo intuición.

1. Identificá tu volumen real de tokens por modelo. La mayoría de los SaaS no tiene esto instrumentado, o lo tiene pero nadie lo mira. Lo que necesitás: un dashboard que muestre tokens consumidos por (modelo, día, tenant) durante los últimos 30 días. Si no lo tenés, dos horas con el log de la API y un query en tu warehouse te lo dejan andando.

2. Calculá el costo por uso lógico de tu producto. No por llamada a la API — por feature de tu producto que la dispara. Ejemplos típicos:

  • "Generar resumen del thread": cuesta X
  • "Clasificar ticket entrante": cuesta Y
  • "Respuesta inicial del agente": cuesta Z
  • "Refactor de código" (si tenés esto): cuesta W

Eso te da el COGS unitario para comparar contra tu plan pricing. Si un usuario Pro paga $29/mes y le generás $12 de inferencia, tenés 41% COGS. Si le generás $4, tenés 14% — el mismo usuario es 3x más rentable después de migrar a Sonnet 5.

3. Medí tu cache hit rate actual. Si estás usando Sonnet 4, Opus 4.8 o cualquiera de los Claude recientes, tenés prompt caching disponible a $0.20-0.50/MTok en cache read. La mayoría de los SaaS tiene hit rate entre 0% (no activó caching) y 30% (activó pero el system prompt es chico). El techo razonable es 60-80% si tu system prompt pesa >500 tokens y se repite por tenant/session.

4. Corré un piloto A/B antes del 31 de agosto. No migres ciegamente. Tomá 5-10% de tu tráfico, rutealo a Sonnet 5, y medí (a) costo, (b) calidad subjetiva con tu eval suite. Si pasa el eval y el costo baja, migrá el resto antes de que termine el precio intro.

5. Negociá pricing enterprise con tu proveedor antes de subir de plan. Si tu volumen pasa de 50M tokens/mes, contactá a Anthropic (o al partner de Bedrock / Vertex AI) para un commit. Los descuentos por commit están en el rango 20-40% sobre el precio público — encima del intro pricing, podés terminar pagando $1.20 / $6 por millón de tokens en lugar de $2 / $10.

Cuándo NO conviene migrar a Sonnet 5

Sonnet 5 es competitivo pero no es reemplazo universal. Tres casos donde te conviene quedarte en Opus 4.8 o subir a Fable 5:

1. Reasoning puro en sesiones muy largas. Si tu producto hace chains de razonamiento de 4+ horas (agentes que navegan codebases enteros, research agents que mantienen coherencia durante días), Sonnet 5 empieza a degradarse. Opus 4.8 o Fable 5 mantienen mejor coherencia en sesiones largas — la diferencia aparece en el último 5-10% de los casos más largos.

2. Professional knowledge work donde 99% de accuracy es material. Si tu producto hace recomendaciones legales, médicas, financieras donde el costo de error es alto, Sonnet 5 te deja 2-3 puntos abajo de Opus 4.8 en benchmarks de dominio. Dependiendo del caso, esos 2-3 puntos se traducen en errores reales una vez cada N llamadas — y cada error te cuesta reputación o un incidente. El ahorro de $0.07 por llamada no compensa un post-mortem de incident.

3. Stack existente que depende del ecosistema OpenAI. Si tu backend ya usa Assistants API, GPT Store, function calling con tools específicas de OpenAI, Vision via Assistants, o fine-tuning sobre modelos OpenAI, el costo de migrar a Claude excede el ahorro de Sonnet 5. En estos casos, migrá el componente específico que pueda correr sobre Claude (clasificación, generación genérica) y dejá el resto en OpenAI. Es el patrón que más veo funcionar: dual-provider con routing por tipo de tarea.

Cuándo NO conviene migrar de Sonnet 5 a Opus 4.8 "por las dudas": si tu eval suite pasa con Sonnet 5, migrar a Opus 4.8 es gastar 2.5x más por una calidad que tu producto no aprovecha. Reserve el upgrade para casos donde tenés evidencia concreta de gap.

Tres prácticas operativas que aplican estés donde estés

Independientemente del modelo que elijas, hay tres optimizaciones que bajan la factura 40-70% combinadas:

1. Activá prompt caching antes de cambiar de modelo. Si no lo activaste todavía, tenés un quick win disponible sin tocar el código del modelo. Para Sonnet 5 el cache read cuesta $0.20/MTok (intro) o $0.30 (regular) — 10-25x más barato que el input fresco. La mayoría de los SaaS con system prompts >500 tokens ve hit rates de 50-70% sin más cambios.

2. Routeá por tipo de tarea, no por defecto único. Un agente de soporte no necesita Sonnet 5 para clasificar (con Haiku 4.5 alcanza) ni GPT-5.6 Sol para extraer datos estructurados (con GPT-5.6 Luna basta). El routing por tarea baja la factura 50-60% sin afectar UX. La parte difícil es instrumentar qué tarea disparó cada llamada — sin eso, no podés rutear.

3. Monitoreá costo por tenant, no solo globalmente. El patrón "todo el costo de API en una sola línea" esconde cuáles tenants son rentables y cuáles te generan margen negativo. Una vez que tenés costo por tenant, podés (a) cappear a los outliers antes de que te quemen la factura del mes, (b) subir el plan de los power users con justificación, (c) cobrar un premium por features caros que solo algunos usan.

Conclusión

El número del título — hasta 80% menos costo de inferencia — es real pero no es "para todos". Para tu SaaS específico depende del ratio input/output, el cache hit rate, y el workload real. Lo que sí es para todos: auditar el COGS de inferencia esta semana, con números reales y decisiones antes del 31 de agosto de 2026.

Tres recomendaciones operativas para el cierre del mes:

  1. No migres ciegamente. Corré un piloto A/B con 5-10% de tu tráfico antes de tocar el resto. Medí costo y calidad con tu eval suite, no con benchmarks generales.
  2. Activá prompt caching esta semana si todavía no lo hiciste. Es el cambio con mejor ROI/tiempo en cualquier modelo Claude.
  3. Negociá commit pricing si pasás de 50M tokens/mes. Anthropic, AWS Bedrock y GCP Vertex AI aceptan commits de 3-12 meses con descuentos material sobre el precio público.

Si tu startup está corriendo sobre Claude o pensando migrar desde GPT-5.6 y querés validar el impacto real con tus números antes de comprometerte, reservá una llamada gratis de 30 minutos — en 20 minutos solemos poder calcularte el ahorro mensual con tu mix de workload real.


Leer también:

Preguntas frecuentes

¿Cuánto cuesta Claude Sonnet 5?

USD 2 por millón de tokens de input y USD 10 por millón de tokens de output durante el período introductorio, que va desde el 30 de junio de 2026 hasta el 31 de agosto de 2026. Después del 1 de septiembre el precio regular es USD 3 / 15 por millón de tokens. Cache write sale USD 2.50 / MTok durante el intro y USD 3.75 después; cache read USD 0.20 / 0.30 por millón.

¿Cuándo termina el precio introductorio?

El 31 de agosto de 2026. Anthropic avisó el corte al anunciar Sonnet 5 el 30 de junio. Si estás evaluando migrar tu SaaS a Sonnet 5, tenés dos meses para correr el piloto con el precio bajo y decidir antes del cambio. Pasado el 31 de agosto el precio sube 50% en input y 50% en output — sigue siendo competitivo, pero el ratio ahorro-versus-Opus baja.

¿Sonnet 5 reemplaza a Opus 4.8 en calidad?

Para el 80% de los workloads SaaS, sí. Sonnet 5 queda cerca de Opus 4.8 en coding y razonamiento multi-paso, según los datos públicos a la fecha. Donde NO alcanza: reasoning puro en problemas muy largos (4+ horas), generación que requiere 99%+ de accuracy y tareas donde Fable 5 sigue siendo el techo. Si tu producto depende crítico de uno de esos casos, el ahorro de Sonnet 5 no se justifica — quedate en Opus 4.8.

¿Conviene migrar de GPT-5.6 Sol a Sonnet 5?

Si tu workload es general (clasificación, generación, razonamiento de longitud media), Sonnet 5 a $2/$10 te queda 2.5x más barato que Sol ($5/$30) por la misma calidad útil. La migración tiene costo único de 1-2 semanas de integración más re-evaluación de prompts. Si estás sobre Assistants API, GPT Store o features específicas de OpenAI, el ahorro no compensa la fricción. Si solo usás la API de chat / responses, el ROI es inmediato.

¿Vale la pena si mi volumen es bajo?

Menos de 100K tokens/mes la diferencia es despreciable (USD 1-2/mes). Entre 100K y 10M tokens/mes es donde el ahorro ya se nota (USD 5-100/mes que podés redirigir a feature work). Por encima de 10M tokens/mes el impacto es material: USD 200-2,000+ /mes dependiendo del mix input/output. Si tu startup está en ese rango y todavía no auditaste el costo de inferencia, esta es tu semana.