La diferencia en una línea
Mismo precio, más capacidad, más control sobre el coste. Opus 5 cuesta como Opus 4.8 — 5$ por millón de tokens de entrada, 25$ de salida — pero rinde más en casi todos los terrenos y añade una palanca que antes no existía: el effort dial.
Si tienes dos minutos y ya usas Opus 4.8, la respuesta breve es: pasa. Abajo tienes los números y las pocas cosas que controlar antes. Si en cambio partes de cero, te conviene leer primero qué es Opus 5.
Los números comparados
En el coding agéntico, el terreno que hoy más pesa, el salto es claro. En SWE-bench Pro Opus 5 marca 79,2% frente al 69,2% de Opus 4.8: diez puntos enteros. Para dar la escala, Sonnet 5 en el mismo test está en 63,2%. En ARC-AGI 3, el benchmark sobre problemas nunca vistos, Opus 5 despega del resto alrededor de tres veces.
También en el frente de la seguridad hay una mejora: Anthropic define a Opus 5 como su Opus "más alineado", con la puntuación más baja en la auditoría de comportamiento interna. Para quien pone agentes en producción no es un detalle: es menos superficie de riesgo. (Los números de benchmark más allá de SWE-bench Verified provienen de informes de terceros sobre los primeros días tras el lanzamiento; el orden de magnitud está consolidado, las cifras concretas hay que tomarlas como indicativas.)
El effort dial cambia la economía
La comparación en el precio de lista cuenta la mitad de la historia. La otra mitad es cuánto gastas de verdad para sacar adelante una tarea. Aquí Opus 5 introduce el effort dial: un dial que regula cuánto hacer razonar al modelo.
Con Opus 4.8 pagabas potencia plena en cada llamada. Con Opus 5 subes el effort donde la tarea es difícil y lo bajas donde basta una respuesta rápida, manteniendo gran parte de la calidad y consumiendo menos tokens. Resultado: a igualdad de precio de lista, el coste por tarea medio baja. Es la razón principal por la que la comparación no es "igual que antes pero un poco mejor", sino un cambio de ecuación.
¿Quieres revisar tu mix de modelos después de Opus 5?
30 minutos para discutir tu caso específico.
Cuándo conviene pasar (y cuándo esperar)
Conviene pasar ya si: ya usas Opus 4.8 en producción, haces correr agentes, o tienes flujos donde el coste por tarea cuenta. Mismo precio, más rendimiento, más control. Casi no hay motivo para quedarse atrás.
Tiene sentido moverse con más calma solo si tienes pipelines muy calibradas y validadas sobre Opus 4.8, con evaluaciones automáticas que no puedes reejecutar rápido. En ese caso no es "no pasar", es "pasa después de haber vuelto a correr tus evals". El modelo nuevo cambia las respuestas: lo que estaba calibrado antes hay que reverificarlo, no darlo por bueno.
Qué revisar en tu configuración
Dos cosas, concretas. Primero, el enrutamiento de los modelos. Con el effort dial puedes mover a Opus 5 (a effort bajo) tareas que antes dabas a un modelo más pequeño para ahorrar. Rehaz la cuenta: podrías simplificar la arquitectura y subir la calidad al mismo coste.
Segundo, los agentes en producción. Opus 5 a effort alto cierra tareas que Opus 4.8 fallaba; a effort bajo te hace ahorrar en las simples. Vuelve a medir tasa de éxito y coste por tarea en tus flujos reales, no en los benchmarks públicos. Y si usas la API, valora las dos nuevas betas — cambio de herramientas a mitad de conversación y fallbacks automáticos — que reducen costes e interrupciones. Hablamos de ello en Opus 5 para el coding.
El cuadro completo de los modelos
Opus 5 no vive solo: encaja con Sonnet 5 para el volumen y con los modelos de frontera para las tareas extremas. Si estás rediseñando tu estrategia de modelos, la cuestión no es "cuál es el mejor" sino "qué tarea a qué modelo, a qué effort". Para un cuadro de conjunto actualizado mira Sonnet, Opus y Haiku comparados y el deep-dive sobre los modelos Claude.
En Maverick AI ayudamos a las empresas a tomar exactamente esta decisión, sin encariñarse con un modelo. Si quieres revisar tu mix después de Opus 5, escríbenos.