El salto en el coding, en números
Opus 5 es, por cómo lo cuentan los benchmarks, el modelo estrella más potente en el coding agéntico. En SWE-bench Pro marca 79,2% frente al 69,2% de Opus 4.8: diez puntos. Para dar escala, Sonnet 5 en el mismo test está en 63,2%, mientras que los modelos de frontera Fable 5 y Mythos 5 rondan el 80%. En SWE-bench Verified la puntuación reportada es aún más alta.
Una nota de método, porque los números cuentan solo si son honestos: aparte de SWE-bench Verified, estas cifras vienen de informes de terceros en los primeros días tras el lanzamiento. El orden de magnitud está consolidado, los porcentajes concretos hay que tomarlos como indicativos hasta que salgan las evals oficiales completas. Si necesitas el cuadro no técnico, parte de qué es Opus 5.
CursorBench y el coste por tarea
El dato más interesante para quien desarrolla no es el pico de calidad, es la relación calidad/coste. En CursorBench 3.2, a effort máximo, Opus 5 llega a alrededor de medio punto de Fable 5 pagando la mitad del coste por tarea. Anthropic sostiene además que, en los niveles de effort alto, xhigh y max, Opus 5 rinde más que cualquier otro modelo a igualdad de coste.
Traducido para un equipo dev: puedes mantener un modelo estrella en todo el flujo — de la lectura del código al refactor al debug — sin la factura de la luz que te obliga a bajar de nivel en las tareas pesadas. Es aquí donde el modelo nuevo cambia los hábitos, no solo los benchmarks.
El effort dial para quien programa
El effort dial es especialmente útil en el desarrollo, donde las tareas tienen dificultad muy distinta. Generar un test unitario trivial y diseñar una migración de esquema compleja no merecen el mismo presupuesto de razonamiento.
Con Opus 5 subes el effort en las tareas arquitectónicas y lo bajas en el trabajo mecánico. El resultado es un coste por sesión más previsible y, en las tareas difíciles, más iteraciones de verificación antes de declarar hecho — Anthropic señala justo un modelo "mejor verificando su propio trabajo e iterando hasta que sale". Para quien hace correr agentes de forma autónoma, es la diferencia entre un agente que entrega y uno que se para a la mitad.
¿Quieres poner Opus 5 a trabajar en tu código?
30 minutos para discutir tu caso específico.
Las dos betas API que cuentan
Junto a Opus 5, Anthropic ha enviado dos funciones beta pensadas para quien construye agentes sobre la API.
La primera: cambio de las herramientas a mitad de conversación sin invalidar la caché del prompt. Un agente puede adquirir o perder tools sobre la marcha — por ejemplo desbloquear el acceso a una base de datos solo tras un check — sin volver a pagar todo el contexto. En flujos largos es un ahorro real. La segunda: fallbacks automáticos. Si una petición es bloqueada por los clasificadores de seguridad, se enruta a otro modelo disponible en vez de fallar. Menos errores no gestionados en producción. Son los remates que separan un prototipo de un agente que aguanta el tráfico de verdad. Para las bases, mira la guía sobre Agent SDK y agentes autónomos.
Qué cambia en Claude Code
En Claude Code, la herramienta de terminal de Anthropic, Opus 5 se convierte en el motor recomendado para el trabajo serio: más fiable en las tareas multi-fichero, mejor verificando y corrigiendo antes de cerrar, con el effort que puedes subir cuando hace falta profundidad. El modo Fast, más rápido al doble del precio, es cómodo cuando la latencia molesta más que el coste — típico de las sesiones interactivas intensas.
Para un equipo que ya trabaja en Claude Code, el upgrade no requiere reescribir nada: cambia el modelo por debajo y vuelve a medir. Si estás llevando Claude Code o los agentes a un contexto empresarial, con control sobre permisos y seguridad, mira Claude Code para las empresas.
¿Vale el upgrade?
Para quien desarrolla con Claude, sí, casi siempre. Mismo precio de lista que Opus 4.8, rendimiento de coding claramente mejor, control del coste con el effort dial y dos betas que quitan fricción a los agentes. La única precaución: reejecutar los propios tests y las propias evals, porque un modelo nuevo cambia los outputs y lo que estaba calibrado antes hay que reverificarlo.
En Maverick AI construimos agentes e integraciones con Claude Code, Agent SDK y MCP, y los llevamos a producción con los controles que hacen falta. Si quieres poner Opus 5 a trabajar en tu código o en tus agentes, escríbenos.