Anthropic lanzó Claude Opus 5 a USD 5/25: cuándo migrar desde Sonnet 5 (y cuándo no)

Anthropic lanzó Claude Opus 5 a USD 5/25: cuándo migrar desde Sonnet 5 (y cuándo no)

2 de agosto del 202616 minAnthropic, Claude, Opus 5, Sonnet 5, AI model pricing, Latam SaaS

Respuesta corta (60 segundos): Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 a USD 5 / 25 por millón de tokens (input/output) — el mismo precio que Opus 4.8, la mitad que Fable 5. Lidera benchmarks de coding agentic con CursorBench y GDPval-AA de punta (fuente Anthropic) y trae Fast mode 2.5x más rápido a 2x el precio base ($10/$50) (fuente Anthropic). Versus Sonnet 5 ($2/$10 intro) es 2.5x más caro. La pregunta para founders SaaS Latam no es "¿es Opus 5 mejor que Sonnet 5?" — claro que sí. La pregunta es ¿cuándo vale pagar 2.5x más? Acá está la tabla de decisión Sonnet 5 / Opus 4.8 / Opus 5 / Fable 5, con math real y la checklist operativa para esta semana.

Hace unos días escribí sobre Sonnet 5 cayendo a $2/$10 y la conclusión era "auditá tu COGS de inferencia esta semana". Hoy la pregunta es la inversa: para algunos workloads, Sonnet 5 ya no es suficiente y migrar a Opus 5 vale los 2.5x. Este post es la guía operativa para decidir cuál.

Disclosure: estuve probando Opus 5 desde la apertura de la API el 24 de julio. Los números de pricing y benchmarks vienen de las publicaciones oficiales de Anthropic, TechCrunch, Axios y The Verge, cruzados con mis propios benchmarks sobre prompts representativos de SaaS Latam. Donde tiro una cifra sin fuente exacta (típicamente throughput, latencia, mis propias mediciones) lo aclaro en el texto.

Qué pasó esta semana (y por qué importa)

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 como nuevo flagship de la tier Opus (fuente Anthropic, TechCrunch). Cuatro datos del lanzamiento que importan para el CFO/CTO de un SaaS:

1. Precio idéntico a Opus 4.8: $5 / $25 por millón de tokens. Anthropic no subió el precio para meter las mejoras — te llevás mejores benchmarks de coding agentic (CursorBench, GDPval-AA) y thinking default gratis. Es la mitad que Fable 5 ($10/$50 MTok), el modelo top de la familia. Para un SaaS que ya estaba en Opus 4.8, el upgrade es un no-brainer en capacidad; el único costo es la migración del model ID en el código.

2. Fast mode 2.5x más rápido, a 2x el precio base. La nota menos cubierta del lanzamiento (Anthropic, The Verge): Opus 5 corre en modo acelerado 2.5x más rápido que el modo estándar, pero cuesta el doble: USD 10 / 50 por millón de tokens en vez de $5 / $25. Pagás 2x por token y terminás la tarea en 0.4x el wall-clock — en workloads interactivos (chat, agents en loop con usuario mirando) el costo por minuto de wall-clock puede ser igual o menor que con Sonnet 5. Es el truco de pricing que no está en el título.

3. Sin 30-day data retention, a diferencia de Fable 5. Opus 5 hereda la política de Anthropic de cero data retention para inference por API. Fable 5 retiene datos 30 días por default (necesario para sus features de training personalizado). Para SaaS que procesa PII, datos financieros o de salud, Opus 5 es estrictamente mejor que Fable 5 en compliance. Si tu cliente enterprise te pide "no guarden mis prompts" y hoy estás en Fable 5, la migración a Opus 5 te desbloquea ese RFP.

4. Más safeguards de cybersec que Opus 4.8. Menos visible pero importante: según The Verge, Anthropic le dio a Opus 5 más safeguards de cybersec que a Opus 4.8 — Opus 5 se ubica entre Sonnet 5 y Fable 5 en capacidad de cybersec, sin alcanzar a Fable 5. Para productos de seguridad, legal o dual-use eso significa que Opus 5 va a rechazar más prompts borderline que Opus 4.8 pero menos que Fable 5 — y nunca al nivel de Fable 5 en tareas puras de cybersec. Si vendés a este segmento, Opus 5 puede no ser tu modelo final.

El contexto macro: la semana pasada cubrimos que Anthropic firmó deal con AMD por USD 5B para diversificar hardware. Opus 5 es la primera entrega de producto sobre esa estrategia — el precio estable a $5/$25 es la promesa de que el compute más barato va a llegar a producción, no se traduce todavía en baja de precio para el cliente.

Tabla de decisión: Sonnet 5 / Opus 4.8 / Opus 5 / Fable 5

Esta es la tabla que wish hubiera tenido la semana del 24 de julio. Pricing vigente al 2 de agosto de 2026 en USD por millón de tokens:

ModeloInputOutputData retentionSWE-bench VerifiedMejor para
Haiku 4.5$1$50 días~70% (estimado)Clasificación, extracción, lightweight agents
Sonnet 5 (intro hasta 31 ago)$2$100 días~91% (estimado público)Generación media, RAG, chat corto, alto volumen
Sonnet 5 (regular desde 1 sep)$3$150 días~91%Idem, con pricing de lista
Opus 4.8$5$250 días88.60%Coding agentic, knowledge work (legado)
Opus 5$5$250 días96-97% (varía por fuente)Coding agentic, long-running agents, reasoning multi-step
Fable 5$10$5030 días95.00%Reasoning puro extremo, training personalizado, ceiling absoluto

Lectura fila por fila:

  • Haiku 4.5 vs Sonnet 5: 2-2.5x más barato. Si tu tarea es clasificación binaria, extracción de JSON, o resumen de 1-2 párrafos, Haiku alcanza. El 80% del tráfico de un SaaS Latam típico es este tipo de tarea — ahí está el ahorro inmediato, sin pensar en Opus 5.
  • Sonnet 5 vs Opus 5: Sonnet 5 cuesta 2.5x menos. La diferencia en capacidad es real (varios puntos en CursorBench / GDPval-AA) pero solo importa en workloads donde esa diferencia cambia el resultado de negocio — coding agentic, refactors largos, RAG sobre codebases, agents que navegan repos.
  • Opus 5 vs Opus 4.8: mismo precio, mejora en CursorBench / GDPval-AA / ARC-AGI-3 según Anthropic. Si estás en Opus 4.8, el upgrade a Opus 5 es gratis en capacidad — solo cambia el model ID. Anthropic no subió el precio para meter las mejoras, lo cual es atípico en el espacio.
  • Opus 5 vs Fable 5: Opus 5 cuesta la mitad. Fable 5 sigue ganando en reasoning puro de sesiones muy largas (4+ horas) y en workloads que necesitan 30-day data retention. Para el 95% de los SaaS, Opus 5 es el sweet spot.
  • Opus 5 vs M3 / Kimi K3 (open weight): Opus 5 gana en managed API, ecosystem y governance. Los open weight ganan en self-hosting, compliance local y costo a volumen alto (>50M tokens/mes). La decisión es de vendor lock-in vs control.

El número que casi nadie mira: Fast mode. Opus 5 en Fast mode corre 2.5x más rápido a 2x el precio base ($10/$50 en vez de $5/$25; fuente Anthropic). En mis tests, eso baja latencia p50 de ~3.2s a ~1.3s en generación de 500 tokens. Para productos interactivos (chat, agent en loop con usuario mirando) eso cambia UX. El "2x más caro por token que Opus 5 estándar" se vuelve "costo similar a Sonnet 5 por minuto de wall-clock" en workloads donde la latencia monetiza.

Qué significa "Opus 5 a $5/$25" en tu unit economics

El número del título suena caro hasta que hacés el cálculo con tu workload real. Acá va el math con dos casos típicos de SaaS Latam.

Caso base: SaaS B2B en español, 10,000 operaciones/mes de un agent que genera contenido rico. Cada operación: 2,200 input + 800 output (tokenizer nuevo de Sonnet 5, +35% vs anterior — Opus 5 hereda el mismo tokenizer).

Costo por 1 millón de tokens combinados

Sin cache, al ratio 73/27 input/output típico de un agent:

ModeloInput/MTokOutput/MTokCosto por 1M tokens combinados
Sonnet 5 (intro)$2$100.73 × 2 + 0.27 × 10 = $4.16
Sonnet 5 (regular)$3$150.73 × 3 + 0.27 × 15 = $6.24
Opus 4.8$5$250.73 × 5 + 0.27 × 25 = $10.40
Opus 5$5$250.73 × 5 + 0.27 × 25 = $10.40
Fable 5$10$500.73 × 10 + 0.27 × 50 = $20.80

Sonnet 5 a 1M tokens es 2.5x más barato que Opus 5. Fable 5 es 2x más caro que Opus 5 al mismo ratio. El 73/27 es la media de un agent; si tu workload es más output-heavy (generación de documentos) la diferencia se achica.

Costo mensual por 1,000 operaciones agentic (sin cache)

Aplicado al caso base (3,000 tokens/op, 1,000 op = 3M tokens):

ModeloCosto/1K operacionesA 10K op/mesA 1M op/mes
Sonnet 5 (intro)$12.48$124.80$12,480
Opus 5 / Opus 4.8$31.20$312.00$31,200
Fable 5$62.40$624.00$62,400

Diferencia Opus 5 vs Sonnet 5 a 1M operaciones/mes: USD 18,720/mes, o USD 224,640/año. Es dinero real — pero la pregunta es si esos puntos extra en benchmarks de coding agentic cambian el resultado para tu caso.

El caso donde Opus 5 vale más que Sonnet 5 (cueste lo que cueste)

Acá está el truco que Fast mode habilita. Si tu agent hace 5 iteraciones internas (tool calls + razonamiento) antes de devolver la respuesta final, Sonnet 5 tarda ~12 segundos totales; Opus 5 con Fast mode tarda ~5 segundos — pero a 2x el precio base. En mis tests, Fast mode baja p50 de ~3.2s a ~1.3s en generación de 500 tokens. Si tu producto es interactivo y la latencia impacta conversión o retención, Opus 5 con Fast mode puede ser la elección correcta aunque cueste más por token: pagás 2x el precio base ($10/$50 vs $5/$25) y terminás la tarea en 0.4x el wall-clock.

Heurística operativa: si tu workload es batch (corre de noche, sin usuario mirando), Fast mode no te sirve — pagás 2x el precio base por velocidad que no monetizás. Si es interactivo, el wall-clock más corto puede más que pagar la diferencia — pero el cálculo de unit economics cambia: ya no es "Opus 5 vs Sonnet 5 a mismo wall-clock" sino "Opus 5 Fast vs Sonnet 5 estándar a distinto wall-clock".

Disclaimer de cálculo: los ratios asumen system prompt ~600 tokens, español con overhead ~38% sobre inglés. Si tu prompt es más corto o el workload es distinto, corré tu propio cálculo.

Qué auditar en tu SaaS esta semana

Checklist operativa para correr lunes a viernes. La idea es que al final de la semana tengas evidencia para la planning, no intuición.

1. ¿Qué porcentaje de tus llamadas son multi-step agentic? Si tu tráfico es <20% agentic (el resto es chat completion, clasificación, RAG one-shot), Sonnet 5 cubre el 80% y Opus 5 es para ese 20%. Si tu tráfico es >60% agentic, Opus 5 con Fast mode puede ser la elección default. La métrica que necesitás: duración media de sesión (en tool turns) y tasa de retries / escalaciones.

2. ¿Tenés data retention constraints? Si tu cliente enterprise te exige 30-day data retention por compliance, estás obligado a Fable 5. Si te exige "cero data retention explícito" y hoy estás en Fable 5, migrá a Opus 5. Si no tenés constraint explícito, Opus 5 default ya es zero-retention — pero confirmalo en el contrato.

3. ¿Probaste Fast mode? Si tu producto es interactivo y no testeaste Opus 5 con Fast mode, te falta el dato más importante de la semana. El cálculo de la sección anterior asume 2.5x más rápido; tu workload real puede ser más o menos. 30 minutos con el playground de Anthropic y un prompt representativo te lo aclaran.

4. ¿Cuál es tu costo por feature de producto, no por API call? El patrón que más veo fallar es mirar la factura agregada de Anthropic sin desglosar por feature. Lo que necesitás: una tabla con feature, costo de inferencia, frecuencia de uso y plan del usuario que la triggerea. Sin eso, la decisión "Opus 5 sí / no" se hace a ciegas.

5. ¿Tenés piloto A/B corriendo o planeado? No migres ciegamente el 100% del tráfico. Tomá 10-20% de las llamadas agentic, rutealas a Opus 5, y medí (a) costo, (b) calidad con tu eval suite, (c) latencia p50/p95 con Fast mode. Una semana de piloto te da la respuesta que seis meses de debate no.

Cuándo NO conviene Opus 5

Opus 5 es competitivo pero no es reemplazo universal. Tres casos donde te conviene quedarte donde estás:

1. Chat completions simples y one-shot summarization. Si tu producto hace "resumí este email", "traducí este párrafo", "clasificá este ticket", Sonnet 5 rinde bien y cuesta 2.5x menos. Opus 5 te da capacidad que no usás. El error más común en julio 2026 fue migrar workloads simples a Opus 5 "porque es más nuevo". No caigas.

2. Workloads con compliance que requiere 30-day data retention. Si tu cliente enterprise te exige por contrato 30-day data retention (típico en financial services, salud, gobierno), Fable 5 es la única opción de la tier alta. Opus 5 explícitamente no la ofrece. No hay upgrade path; hay que quedarse en Fable 5 o migrar a un modelo que sí lo soporte.

3. Alto volumen en español con márgenes ajustados. Si tu SaaS opera a >10M tokens/mes en español y tu margen bruto es <40%, la diferencia de 2.5x entre Sonnet 5 y Opus 5 puede ser la línea entre rentable y break-even. El upgrade a Opus 5 vale si tu pricing captura el valor (planes Pro/Premium, B2B con ACV alto). Si no lo captura, el upgrade te empuja a negativo.

Cuándo NO conviene quedarse en Sonnet 5 "por las dudas": si tu eval suite falla en 5-15% de los casos agentic con Sonnet 5, y la falla genera escalación humana o ticket de soporte, el costo de la escalación probablemente excede el ahorro de Sonnet 5. Calculá costo de la falla (tiempo humano, churn) versus delta de inferencia. Muchas veces Opus 5 sale más barato real aunque cueste 2.5x por token.

Tres prácticas operativas que aplican estés donde estés

Independientemente del modelo que elijas, hay tres optimizaciones que bajan la factura 30-50% combinadas y que aplican estés en Sonnet 5, Opus 5 o Fable 5:

1. Activá prompt caching antes de cambiar de modelo. Si no lo activaste todavía, tenés un quick win disponible sin tocar el modelo. En Opus 5, cache read cuesta $0.50/MTok — 5-10x más barato que el input fresco. La mayoría de los SaaS con system prompts >500 tokens ve hit rates de 50-70% sin más cambios. Es el cambio con mejor ROI/tiempo disponible hoy.

2. Routeá por tipo de tarea, no por defecto único. Un agent de soporte no necesita Opus 5 para clasificar (Haiku 4.5 alcanza) ni para generar respuestas simples (Sonnet 5 alcanza). El routing por tipo de tarea baja la factura 50-60% sin afectar UX. La parte difícil es instrumentar qué tarea disparó cada llamada — sin eso, no podés rutear.

3. Monitoreá costo por tenant, no solo globalmente. El patrón "todo el costo de API en una sola línea" esconde cuáles tenants son rentables y cuáles te generan margen negativo. Una vez que tenés costo por tenant, podés (a) cappear a los outliers antes de que te quemen la factura, (b) subir el plan de los power users con justificación, (c) cobrar premium por features caros que solo algunos usan.

Conclusión

Opus 5 no reemplaza a Sonnet 5 — lo complementa. La pregunta correcta no es "¿migro todo a Opus 5?" sino "¿qué 20% de mi tráfico vale 2.5x más, y qué 80% se queda en Sonnet 5?". La respuesta depende de tu mix de workload, tu pricing y tu eval suite, no del press release.

Tres recomendaciones operativas para esta semana:

  1. Auditá tu mix agentic vs one-shot. Si tu tráfico es <20% agentic, Sonnet 5 es tu default. Si es >60% agentic y/o interactivo, probá Opus 5 con Fast mode en un piloto A/B. La métrica que necesitás: % de llamadas que son multi-step vs single-shot.
  2. Resolvé tu data retention constraint antes de elegir tier. Si necesitás 30-day retention, Fable 5. Si necesitás zero retention explícito, Opus 5 (no Fable 5). Si no tenés constraint, Opus 5 default ya es zero — pero dejá por escrito el SLA contractual.
  3. No migres ciegamente. Corré un piloto A/B con 10-20% de tu tráfico agentic. Medí costo, calidad (con tu eval suite) y latencia p50/p95 con Fast mode. Una semana de datos reales te da la respuesta que seis meses de debate no.

Si tu startup está corriendo sobre Claude o pensando cómo repartir tráfico entre Sonnet 5, Opus 5 y Fable 5, y querés validar el impacto real con tus números antes de comprometerte, reservá una llamada gratis de 30 minutos — en 20 minutos solemos poder calcularte el ahorro mensual con tu mix de workload real.


Leer también:

Preguntas frecuentes

¿Cuánto cuesta Claude Opus 5?

USD 5 por millón de tokens de input y USD 25 por millón de tokens de output, idéntico al precio de Opus 4.8. Es la mitad que Fable 5 ($10/$50 MTok) y 2.5x más caro que Sonnet 5 durante el precio introductorio ($2/$10 MTok, vigente hasta el 31 de agosto de 2026). Opus 5 no tiene el precio introductorio bajo de Sonnet 5 — el precio es estable desde el lanzamiento el 24 de julio de 2026.

¿Opus 5 reemplaza a Sonnet 5 o a Opus 4.8?

A ninguno. Opus 5 ocupa un slot distinto: es "casi Fable 5 a mitad de precio", no "Sonnet 5 más caro". Versus Sonnet 5 ($2/$10) es 2.5x más caro, pero lidera benchmarks de coding agentic (CursorBench, GDPval-AA, ARC-AGI-3) según la página oficial de Anthropic. Versus Opus 4.8 ($5/$25) cuesta lo mismo pero mejora los mismos benchmarks en ~5-10 puntos según el suite. La decisión correcta depende del workload: tareas cortas/alto volumen se quedan en Sonnet 5, tareas largas/agentic van a Opus 5, y sólo si necesitás el techo absoluto pagás Fable 5.

¿Qué es Fast mode y cuánto más rápido es?

Fast mode es la opción de inferencia acelerada de Opus 5 que corre el modelo 2.5x más rápido que el modo estándar, a 2x el precio base: USD 10 input / USD 50 output por millón de tokens (el doble de los $5/$25 estándar). Anthropic lo anunció el 24 de julio de 2026. Pagás 2x por token pero terminás la tarea en 0.4x el wall-clock — para workloads interactivos (chat, agents en loop con usuario mirando) el costo por minuto de wall-clock puede ser igual o menor que con Sonnet 5. Para batch offline, pagás 2x por velocidad que no monetizás.

¿Opus 5 guarda mis datos?

No por default. Opus 5 hereda la política de Anthropic de no usar los datos de API para entrenar modelos, y la retención de datos es cero (no 30 días como Fable 5). Para workloads con datos sensibles (PII, financieros, salud) eso es una mejora sobre Fable 5. Si necesitás la política de cero data retention explícita por contrato enterprise, está disponible vía Zero Data Retention add-on de Anthropic — pero el default ya es estricto.

¿Cuándo NO conviene migrar a Opus 5?

Tres casos claros. (1) Chat completions simples o one-shot summarization donde Sonnet 5 rinde bien y cuesta 2.5x menos. (2) Tareas de clasificación o extracción de datos donde Haiku 4.5 ($1/$5) o Sonnet 5 ($2/$10) alcanzan. (3) Workloads donde necesitás 30-day data retention por compliance (Fable 5 sigue siendo la única opción de la tier alta que lo ofrece — Opus 5 NO). En cualquiera de estos tres casos, pagás 2.5x más por capacidad que no usás.