Claude Opus 5: qué cambia frente a Opus 4.8 y cuándo usarlo (2026)

Claude Opus 5: qué cambia frente a Opus 4.8 y cuándo usarlo (2026)

25 de julio del 20269 minClaude Opus 5, Anthropic, IA, LLM, Coding

Respuesta corta (60 segundos): Claude Opus 5 es el nuevo modelo de la tier Opus de Anthropic (lanzado el 24 de julio de 2026). Mantiene el precio de Opus 4.8 ($5/MTok input, $25/MTok output), sube a 1M de contexto, y trae thinking habilitado por default. Lidera SWE-bench Verified con 97.00%. Cuándo elegirlo: coding agentic y knowledge work donde la diferencia entre 97% y 95% en benchmarks no se traduce en valor de negocio — te llevás casi lo mismo que Fable 5 a mitad de precio. Cuándo no: si necesitás self-hosting (los open-weight M3 o Kimi K3 ganan) o el techo absoluto de capacidad sin importar costo (ahí sigue Fable 5).

Claude Opus 5 es el lanzamiento más reciente de Anthropic en la tier Opus, apenas dos meses después de Opus 4.8 (28 de mayo de 2026). Este post es la guía que wish hubiera tenido el día del anuncio: qué cambia, qué queda igual, cuánto cuesta realmente, y la pregunta práctica — ¿para qué workload conviene migrar y para qué no?

Disclosure: estuve probando Opus 5 desde la apertura del acceso en Claude API el 24 de julio. No es "uso diario" todavía (literalmente tiene un día), pero los datos de abajo vienen de prompts reales que corrí contra Opus 5 y Opus 4.8 en paralelo, no solo del blog oficial.

Qué cambia frente a Opus 4.8

Anthropic posiciona Opus 5 como "casi la inteligencia frontier de Claude Fable 5 a mitad de precio". Tres cambios concretos justifican esa frase:

1. Coding agentic mediblemente mejor. Opus 5 lidera SWE-bench Verified con 97.00%, arriba de GPT-5.6 Sol (96.20%) y Fable 5 (95.00%). Comparado con Opus 4.8 (88.60%), es un salto de ~8.4 puntos — no incremental, sino un cambio de tier. En SWE-bench Pro, donde los problemas son más largos y desordenados, Opus 5 llega a 79.2% (Fable 5 está en 80.0%, Mythos 5 lidera con 80.3%). En coding real, esa diferencia se nota sobre todo en sesiones de varias horas y navegación de repos grandes.

2. Thinking habilitado por default. Hasta Opus 4.8, el extended thinking era opt-in: tenías que pasar thinking={"type": "enabled", "budget_tokens": N} en cada llamada. En Opus 5 viene activado por default, con presupuesto adaptativo según la complejidad del prompt. Eso cambia el comportamiento del modelo en tareas de varios pasos sin que tengas que tocar el código.

3. Agents long-running más estables. Anthropic reporta mejoras explícitas en sesiones agentic de varias horas con mínima supervisión. Combinado con el context window de 1M, podés pasarle un codebase entero y mantener el hilo durante sesiones largas sin compactación.

Hay un cuarto cambio que no es de capacidad pero importa: cybersecurity safeguards reforzados. Anthropic los reforzó después de las conversaciones con regulators gubernamentales sobre uso dual. En la práctica, vas a ver más rate limiting y más refusal patterns en prompts ambiguos. No es un deal-breaker, pero conviene saberlo si venís de Opus 4.8.

Specs y pricing

SpecValor
Model IDclaude-opus-5
Context window1M tokens (default y máximo)
Max output128k tokens
ThinkingHabilitado por default (presupuesto adaptativo)
Input pricing$5 / millón de tokens
Output pricing$25 / millón de tokens
DisponibilidadClaude API, Amazon Bedrock, Claude Pro/Max/Team/Enterprise

El pricing es idéntico a Opus 4.8 — Anthropic no subió tarifas para incorporar las mejoras. Para ponerlo en perspectiva, Opus 5 cuesta la mitad que Fable 5 ($10/$50 MTok) y un cuarto que Mythos 5 (top-tier por encima de Fable).

Disponibilidad por plan:

  • Claude Max: Opus 5 pasa a ser el modelo default. Si tenías Opus 4.8 configurado, migrá a claude-opus-5 para aprovechar thinking default y mejor coding.
  • Claude Pro: Opus 5 es el modelo más fuerte disponible en el tier Pro.
  • Claude Team y Enterprise: disponible con la governance que ya tenés configurada.
  • Claude API y Amazon Bedrock: modelo claude-opus-5 desde el 24 de julio.

Cómo usar Opus 5 con el SDK de Anthropic

El SDK de Python no cambió — solo cambia el model ID. Esto es lo mínimo para empezar:

import os
from anthropic import Anthropic

client = Anthropic(api_key=os.environ.get("ANTHROPIC_API_KEY"))

message = client.messages.create(
    model="claude-opus-5",  # antes era "claude-opus-4-8"
    max_tokens=1024,
    messages=[
        {"role": "user", "content": "Refactorizá este módulo para usar async/await en vez de callbacks."}
    ],
)

print(message.content[0].text)

Si venías usando extended thinking opt-in (con thinking={"type": "enabled", ...}), podés sacar el bloque: Opus 5 ya piensa por default. Si querés controlar el presupuesto explícitamente, el parámetro sigue funcionando:

response = client.messages.create(
    model="claude-opus-5",
    max_tokens=16000,
    thinking={
        "type": "enabled",
        "budget_tokens": 10000,  # explícito si querés override del default adaptativo
    },
    messages=[{"role": "user", "content": "Resolvé este problema de scheduling..."}],
)

Streaming funciona igual que antes, y el bloque thinking aparece en response.content con type="thinking" antes del bloque de texto final. Si tenías lógica que lee thinking blocks, no cambia nada.

Para más detalles sobre el SDK y los demás endpoints, la documentación oficial de Anthropic está al día.

Benchmarks: dónde Opus 5 es frontier y dónde todavía no

Datos públicos al 25 de julio de 2026, comparando los modelos más fuertes disponibles:

Coding (SWE-bench Verified):

ModeloScore
Claude Opus 597.00%
GPT-5.6 Sol96.20%
Claude Fable 595.00%
Kimi K393.40%
GPT-5.6 Luna93.00%
Claude Opus 4.888.60%
Grok 4.586.60%

Opus 5 lidera coding por un margen claro, pero la distancia con Fable 5 (1.8 puntos) y GPT-5.6 Sol (0.8 puntos) es chica. En coding agentic real, esa diferencia rara vez se traduce en productividad adicional — los tres están en el cluster "lo suficientemente bueno como para no preocuparte por el modelo".

SWE-bench Pro (más largo y desordenado): Mythos 5 lidera con 80.3%, Fable 5 80.0%, Opus 5 79.2%. Acá Opus 5 ya está 0.8 puntos abajo de Fable 5 — la diferencia empieza a aparecer en tareas de varias horas donde los problemas se acumulan.

Frontier-bench v0.1 (reasoning general): Opus 5 llega a 43.3% pass rate. No tengo el número exacto de Fable 5 y Mythos 5 en este benchmark al cierre de este post, pero la tendencia es la misma — Opus 5 está cerca del techo pero no llega.

Lo que Opus 5 todavía no alcanza vs Fable 5:

  • Reasoning puro en problemas muy largos (Fable 5 mantiene coherencia mejor en sesiones de 4+ horas)
  • Professional knowledge work donde la diferencia entre "97% correcto" y "99% correcto" es material (legal, medical research, análisis financiero fino)
  • Velocidad de inference bajo carga masiva (Fable 5 tiene infra más optimizada)

En coding agentic y knowledge work estándar, Opus 5 es indistinguible de Fable 5 para el 95% de los workloads. La diferencia aparece solo en el último 5%, donde el costo extra de Fable 5 empieza a justificarse.

Cuándo elegir Opus 5 — y cuándo no

Elegí Opus 5 si:

  • Tu workload es coding agentic, refactoring, o knowledge work estándar
  • Querés mantener el costo de Opus 4.8 ($5/$25) pero subir un escalón de capacidad
  • Usás Claude Max y querés el modelo default actualizado
  • Necesitás 1M de contexto sin compactación para pasar codebases enteros
  • El ecosistema de Anthropic (SDK, integrations, governance) te sirve

Elegí Claude Fable 5 si:

  • Tu workload es reasoning puro de varios pasos en sesiones muy largas (4+ horas)
  • Professional knowledge work donde el último 1-2% de accuracy es material
  • El costo no es problema y querés el techo absoluto de Anthropic
  • Necesitás prompt caching agresivo (Fable 5 tiene cache hits a $1/MTok)

Elegí MiniMax M3 si:

  • Necesitás self-hosting por compliance, costo, o control de datos
  • Tu producto es inherentemente multimodal (video, audio + texto)
  • Querés evitar vendor lock-in a Anthropic
  • El volumen de tokens justifica operar tu propia infra (H100 dedicado)

Elegí Kimi K3 si:

  • Querés open weights pero con más madurez en coding long-horizon que M3
  • Tu workload es principalmente texto (no necesitás multimodalidad nativa de M3)
  • Esperás al 27 de julio para usar los pesos abiertos sin pagar API

Elegí GPT-5.6 Sol si:

  • Tu stack ya está sobre OpenAI y cambiar te genera fricción
  • Necesitás features específicos del ecosistema OpenAI (Assistants API, GPT Store, etc.)

El ángulo LATAM: qué cambia con Opus 5

Para developers y empresas en LATAM, Opus 5 importa por tres razones concretas:

1. Mejor relación precio/performance en managed API. LATAM sigue pagando USD por tokens como el resto del mundo, pero la diferencia entre $5/MTok (Opus 5) y $10/MTok (Fable 5) se nota en facturas a volumen medio. Para equipos de 5-20 engineers corriendo agents de coding, migrar de Opus 4.8 a Opus 5 les da ~8 puntos extra de SWE-bench sin cambio de costo.

2. Claude Max como modelo default. Si muchos developers hispanos están en Claude Max (probable, dado el pricing relativamente accesible vs Fable 5 directo), Opus 5 les llega automáticamente. No hay que hacer nada — solo verificar que el model ID actualizado esté en uso.

3. Thinking default reduce fricción. En LATAM, donde muchos equipos adoptan AI más tarde que en US, el opt-in thinking era una barrera: había que saber que existía, leer la doc, configurarlo. Con Opus 5 viene por default, lo que baja la curva de aprendizaje para equipos que están empezando con agents.

Lo que Opus 5 no resuelve para LATAM:

  • Compliance de datos. Opus 5 sigue siendo managed API en servers de Anthropic. Si necesitás datos en la región (regulaciones locales), self-hosting con M3 o Kimi K3 sigue siendo la única ruta.
  • Costo a volumen alto. Self-hosting con open weights sigue siendo 30-50% más barato que cualquier API managed a partir de ~50M tokens/mes.

¿Querés discutir si Opus 5 tiene sentido para tu stack antes de migrar? Hay un CTA al final con una llamada gratis de 30 minutos.

Preguntas frecuentes

¿Qué es Claude Opus 5 en una frase?

Es el modelo más reciente de la tier Opus de Anthropic, lanzado el 24 de julio de 2026. Mantiene el precio de Opus 4.8 ($5/MTok input, $25/MTok output), sube a 1M de contexto con thinking habilitado por default, y queda cerca del rendimiento de Claude Fable 5 a mitad de precio.

¿Qué cambia frente a Opus 4.8?

Tres cambios principales: (1) coding agentic más fuerte — lidera SWE-bench Verified con 97.00% vs 88.60% de Opus 4.8; (2) thinking habilitado por default en vez de opt-in, lo que cambia cómo se comporta en tareas de varias pasos; (3) mejoras en agents long-running y cybersecurity safeguards por pedido de regulators. El context window y el pricing quedan iguales.

¿Cuánto cuesta?

$5 por millón de tokens de input y $25 por millón de tokens de output — idéntico a Opus 4.8. Está disponible en Claude API, Amazon Bedrock, y los planes Pro, Max, Team y Enterprise de Claude. En Max pasa a ser el modelo default; en Pro es el más fuerte disponible.

¿Cuándo conviene Opus 5 sobre Claude Fable 5?

Fable 5 sigue siendo el top-tier de Anthropic (lanzado el 9 de junio de 2026, $10/$50 MTok) y lidera en tareas de reasoning puro y agentic profesional. Si tu workload es coding agentic o knowledge work donde la diferencia real entre 97% y 95% en SWE-bench no se traduce en valor de negocio, Opus 5 te da casi lo mismo a mitad de precio. Elegí Fable 5 solo si necesitás el techo absoluto de capacidad y el costo no es problema.

¿Cuándo conviene Opus 5 sobre MiniMax M3 o Kimi K3 (open-weight)?

Si querés managed API sin operar infra, o si necesitás el UX pulido y el ecosistema de integraciones de Anthropic. Si en cambio necesitás self-hosting por compliance de datos LATAM, costo a volumen alto, o querés evitar vendor lock-in, los open-weight ganan: M3 con multimodalidad nativa y Kimi K3 con su release open del 27 de julio.

¿Opus 5 funciona bien en español?

Sí. El training multilingüe de Anthropic rinde bien con prompts en español latinoamericano, igual que Opus 4.8 y Fable 5. Para casos técnicos específicos (legal LATAM, contratos en español con terminología local) recomiendo probar con tus propios prompts antes de comprometerte a un workload grande.