Guía8 min lecturaPublicado el 2026-07-24

Claude Opus 5 para el coding: benchmarks, effort dial y las novedades para quien construye agentes

Claude Opus 5 para el desarrollo: SWE-bench Pro al 79,2%, CursorBench cerca de Fable 5 a mitad de coste, el effort dial y las dos betas API para los agentes. Qué cambia en Claude Code.

En resumen

En el coding Opus 5 da un salto claro: SWE-bench Pro del 69,2% de Opus 4.8 al 79,2%, y en CursorBench 3.2 a effort máximo llega a medio punto de Fable 5 pagando la mitad del coste por tarea. Añade el effort dial para equilibrar calidad y gasto, y dos betas API — cambio de herramientas a mitad de conversación sin perder la caché, y fallbacks automáticos. Para equipos que usan Claude Code o construyen agentes, es el upgrade a hacer.

El salto en el coding, en números

Opus 5 es, por cómo lo cuentan los benchmarks, el modelo estrella más potente en el coding agéntico. En SWE-bench Pro marca 79,2% frente al 69,2% de Opus 4.8: diez puntos. Para dar escala, Sonnet 5 en el mismo test está en 63,2%, mientras que los modelos de frontera Fable 5 y Mythos 5 rondan el 80%. En SWE-bench Verified la puntuación reportada es aún más alta.

Una nota de método, porque los números cuentan solo si son honestos: aparte de SWE-bench Verified, estas cifras vienen de informes de terceros en los primeros días tras el lanzamiento. El orden de magnitud está consolidado, los porcentajes concretos hay que tomarlos como indicativos hasta que salgan las evals oficiales completas. Si necesitas el cuadro no técnico, parte de qué es Opus 5.

CursorBench y el coste por tarea

El dato más interesante para quien desarrolla no es el pico de calidad, es la relación calidad/coste. En CursorBench 3.2, a effort máximo, Opus 5 llega a alrededor de medio punto de Fable 5 pagando la mitad del coste por tarea. Anthropic sostiene además que, en los niveles de effort alto, xhigh y max, Opus 5 rinde más que cualquier otro modelo a igualdad de coste.

Traducido para un equipo dev: puedes mantener un modelo estrella en todo el flujo — de la lectura del código al refactor al debug — sin la factura de la luz que te obliga a bajar de nivel en las tareas pesadas. Es aquí donde el modelo nuevo cambia los hábitos, no solo los benchmarks.

El effort dial para quien programa

El effort dial es especialmente útil en el desarrollo, donde las tareas tienen dificultad muy distinta. Generar un test unitario trivial y diseñar una migración de esquema compleja no merecen el mismo presupuesto de razonamiento.

Con Opus 5 subes el effort en las tareas arquitectónicas y lo bajas en el trabajo mecánico. El resultado es un coste por sesión más previsible y, en las tareas difíciles, más iteraciones de verificación antes de declarar hecho — Anthropic señala justo un modelo "mejor verificando su propio trabajo e iterando hasta que sale". Para quien hace correr agentes de forma autónoma, es la diferencia entre un agente que entrega y uno que se para a la mitad.

¿Quieres poner Opus 5 a trabajar en tu código?

30 minutos para discutir tu caso específico.

Reservar una llamada

Las dos betas API que cuentan

Junto a Opus 5, Anthropic ha enviado dos funciones beta pensadas para quien construye agentes sobre la API.

La primera: cambio de las herramientas a mitad de conversación sin invalidar la caché del prompt. Un agente puede adquirir o perder tools sobre la marcha — por ejemplo desbloquear el acceso a una base de datos solo tras un check — sin volver a pagar todo el contexto. En flujos largos es un ahorro real. La segunda: fallbacks automáticos. Si una petición es bloqueada por los clasificadores de seguridad, se enruta a otro modelo disponible en vez de fallar. Menos errores no gestionados en producción. Son los remates que separan un prototipo de un agente que aguanta el tráfico de verdad. Para las bases, mira la guía sobre Agent SDK y agentes autónomos.

Qué cambia en Claude Code

En Claude Code, la herramienta de terminal de Anthropic, Opus 5 se convierte en el motor recomendado para el trabajo serio: más fiable en las tareas multi-fichero, mejor verificando y corrigiendo antes de cerrar, con el effort que puedes subir cuando hace falta profundidad. El modo Fast, más rápido al doble del precio, es cómodo cuando la latencia molesta más que el coste — típico de las sesiones interactivas intensas.

Para un equipo que ya trabaja en Claude Code, el upgrade no requiere reescribir nada: cambia el modelo por debajo y vuelve a medir. Si estás llevando Claude Code o los agentes a un contexto empresarial, con control sobre permisos y seguridad, mira Claude Code para las empresas.

¿Vale el upgrade?

Para quien desarrolla con Claude, sí, casi siempre. Mismo precio de lista que Opus 4.8, rendimiento de coding claramente mejor, control del coste con el effort dial y dos betas que quitan fricción a los agentes. La única precaución: reejecutar los propios tests y las propias evals, porque un modelo nuevo cambia los outputs y lo que estaba calibrado antes hay que reverificarlo.

En Maverick AI construimos agentes e integraciones con Claude Code, Agent SDK y MCP, y los llevamos a producción con los controles que hacen falta. Si quieres poner Opus 5 a trabajar en tu código o en tus agentes, escríbenos.

FT
Federico Thiella·Founder, Maverick AI

Trabaja con empresas europeas en la adopción de Claude y el ecosistema Anthropic. Ha liderado implementaciones de IA en private equity, consultoría, manufactura y servicios profesionales.

LinkedIn

¿Quieres poner Opus 5 a trabajar en tu código?

Construimos agentes e integraciones con Claude Code, Agent SDK y MCP y los llevamos a producción con los controles adecuados. Escríbenos.

Escríbenos

Preguntas frecuentes: Opus 5 para el coding

Mucho: en SWE-bench Pro marca 79,2% frente al 69,2% de Opus 4.8, y es el modelo estrella más potente en el coding agéntico. En CursorBench 3.2 a effort máximo llega a alrededor de medio punto de los modelos de frontera pagando la mitad del coste por tarea. Los números más allá de SWE-bench Verified provienen de informes de terceros y hay que tomarlos como indicativos.
Sí. Opus 5 está disponible en Claude Code y es el motor recomendado para el trabajo de desarrollo serio, con la posibilidad de regular el effort y de usar el Fast mode en las sesiones interactivas. No hace falta reescribir nada: cambia el modelo y vuelve a medir.
Dos funciones para quien construye agentes: el cambio de las herramientas a mitad de conversación sin invalidar la caché del prompt, y los fallbacks automáticos que enrutan a otro modelo las peticiones bloqueadas por los clasificadores de seguridad en vez de hacerlas fallar. Ambas reducen costes e interrupciones en producción.
En la mayoría de los casos sí: mismo precio que Opus 4.8, mejor coding, control del coste con el effort dial. La única precaución es reejecutar los propios tests y las propias evaluaciones, porque un modelo nuevo cambia los outputs.
Fable 5 y Mythos 5 siguen ligeramente por delante en los picos de calidad, pero Opus 5 llega cerca pagando alrededor de la mitad del coste por tarea, y a igualdad de coste los supera. Para el trabajo de desarrollo diario de un equipo, Opus 5 es casi siempre la elección con la mejor relación calidad/precio.

Mantente informado sobre IA para empresas

Recibe actualizaciones sobre Claude AI, casos de uso empresariales y estrategias de implementación. Sin spam, solo contenido útil.

¿Quiere saber más?

Contáctenos para descubrir cómo podemos ayudar a su empresa con soluciones de IA a medida.

Partner de implementación de Anthropic en Italia. Trabajamos con empresas de PE, pharma, moda, manufactura y consultoría.

Artículos relacionados

News

Claude Opus 5: el modelo estrella ahora tiene un "dial" para el coste — qué cambia para las empresas

Anthropic ha lanzado Claude Opus 5: cerca de Fable 5 en muchas tareas a la mitad del coste por tarea, con un "effort dial" que regula cuánto razona el modelo. Precio, benchmarks y qué significa para quien usa la IA en la empresa.

Técnico

Claude Code: qué es y cómo utilizarlo en la empresa

Claude Code es la herramienta CLI de Anthropic que lleva la IA directamente al flujo de trabajo del desarrollador. Descubra qué es, cómo funciona y cómo las empresas lo utilizan para desarrollo, automatización y revisión de código.

Tecnología

Agent SDK: cómo construir agentes de IA autónomos con Claude

Qué es el Agent SDK de Anthropic, cómo funciona, cómo diseñar agentes de IA autónomos y cuáles son las aplicaciones enterprise más prometedoras.

News

Claude Sonnet 5: rendimiento de Opus a precio de Sonnet — qué cambia para las empresas

Anthropic ha lanzado Claude Sonnet 5: más agéntico, cercano a Opus 4.8 y más económico. Precios, rendimiento y qué significa para quien usa la IA en la empresa.

Comparativa

Opus 5 vs Opus 4.8: qué cambia de verdad y si conviene pasar

Comparación entre Claude Opus 5 y Opus 4.8: mismo precio de lista, mejor rendimiento y el nuevo effort dial. Cuándo conviene pasar y qué revisar en tu configuración.

Técnico

Claude API: Guía de Integración para Desarrolladores

Guía completa para desarrolladores sobre la integración de la Claude API. Cubre autenticación, selección de modelos, diseño de prompts, límites de tasa, gestión de errores y mejores prácticas en producción para despliegues enterprise.

Reserva una llamada introductoria
Claude Opus 5 para el coding: benchmarks y Claude Code (2026) | Maverick AI