Anthropic presentó Claude Opus 5 el 24 de julio de 2026 y, tres semanas después, medio sector jurídico sigue repitiendo una cifra que casi nadie ha mirado de cerca: triplica al siguiente modelo en la prueba diseñada para medir inteligencia de verdad. Es cierto. Y también es, para un despacho, casi irrelevante. Este artículo separa las dos cosas: lo que los benchmarks de Opus 5 demuestran, y la única pregunta que ninguno de ellos responde.
Qué es Claude Opus 5 y qué ha presentado Anthropic#
Claude Opus 5 es el modelo insignia de Anthropic y llega con una decisión comercial poco habitual: no sube de precio. Se mantiene en 5 dólares por millón de tokens de entrada y 25 por millón de salida, exactamente lo mismo que Opus 4.8, mientras que su competidor de gama alta, Fable 5, se sitúa en 10 y 50 dólares respectivamente.
Las cifras que importan
La prueba que ha dado el titular es ARC-AGI-3, un test que presenta problemas visuales que el modelo no ha podido ver durante su entrenamiento. Es lo más parecido que existe hoy a medir si una máquina razona en lugar de recordar. Y ahí la distancia no es de matiz:
En las dos generaciones anteriores del mismo test, verificadas de forma independiente por ARC Prize, el modelo alcanza un 97,5 % en ARC-AGI-1 y un 90,4 % en ARC-AGI-2 con esfuerzo máximo. Son cifras de saturación: esas pruebas han dejado de discriminar.
Traducido al trabajo de un despacho#
Un abogado no contrata un modelo por su puntuación en rompecabezas visuales. Lo que sí se traduce es otra cosa: la capacidad de encadenar pasos sin supervisión. Es la diferencia entre pedirle un resumen y pedirle que busque, contraste, descarte y redacte.
| Prueba | Qué mide en realidad | Resultado de Opus 5 |
|---|---|---|
| ARC-AGI-3 | Razonar ante un problema nunca visto | 30,2 %, triple que el siguiente |
| Frontier-Bench v0.1 | Tareas complejas de extremo a extremo | 43,3 %, más del doble que Opus 4.8 |
| Zapier AutomationBench | Automatizar flujos reales de trabajo | ~1,5× el siguiente modelo, a igual coste |
| OSWorld 2.0 | Manejar un ordenador como un usuario | Supera a Fable 5 por un tercio de su coste |
| CursorBench 3.2 | Programación asistida | A menos de 0,5 puntos de Fable 5, a mitad de precio |
Traducido: para un despacho que quiera montar flujos —revisar una carpeta de contratos, cruzar veinte escritos, preparar un cuadro de plazos— este modelo hace en una pasada lo que antes exigía trocear en diez peticiones. Ese es el salto real, y no la cifra de titular.
La letra pequeña que casi nadie cuenta#
Aquí es donde conviene bajar el entusiasmo dos puntos, porque hay tres matices que los titulares se saltaron.
Más esfuerzo no siempre es mejor#
Claude Opus 5 se puede ajustar en cuatro niveles de razonamiento (bajo, medio, alto y máximo). Lo intuitivo sería dejarlo siempre al máximo. Pues bien: en las evaluaciones de código de frontera el rendimiento hace techo en esfuerzo medio, en torno al 53 %, y empeora al subir de ahí, además de costar más. Es un comportamiento contraintuitivo y una invitación clarísima a medir con sus propias tareas antes de fijar la configuración.

No gana en todos los marcadores#
El Epoch Capabilities Index, que agrega resultados de muchas pruebas en un solo número, coloca a Opus 5 por detrás de Fable 5 y GPT-5.6 en capacidad agregada. Y GPT-5.6 Sol sigue por delante en algunos benchmarks de programación consolidados. La conclusión honesta no es «Opus 5 es el mejor modelo», sino «Opus 5 es el mejor en razonamiento nuevo y en relación capacidad-precio».
Un benchmark no es su despacho#
Todas estas pruebas se ejecutan en inglés, sobre tareas de programación, ciencia o manejo de escritorio. Ninguna incluye un recurso de suplicación, un cuadro de plazos procesales ni la búsqueda de una doctrina consolidada del Tribunal Supremo. La transferencia existe, pero no es automática.
Los benchmarks miden si el modelo es inteligente. No miden si le va a mentir con cara de seguridad.
Lo que ninguna cifra mide: si se inventa la jurisprudencia#
Este es el punto que separa una conversación de tecnología de una conversación profesional. Un modelo de lenguaje, por brillante que sea, genera texto plausible. Si le pregunta por una sentencia y no tiene delante la fuente, producirá una cita con estructura perfecta —sala, fecha, número de recurso, ponente, párrafo entrecomillado— que puede no existir.
No es un riesgo teórico. Es un riesgo tasado, con importe.
Merece la pena leer cómo razona la Sala el importe, porque es de una ironía perfecta. El tribunal parte del coste de una suscripción profesional a una herramienta de IA jurídica —unos 70 euros al mes, 840 euros al año— y lo toma como referencia de la multa. Después la rebaja a la mitad, hasta los 420 euros, porque el letrado admitió los hechos y se apuntó a un curso de competencias digitales del Consejo General de la Abogacía. Dicho de otro modo: le multaron con lo que habría costado hacerlo bien.
El auto también recuerda los precedentes. El acuerdo del Tribunal Constitucional de 9 de septiembre de 2023 sancionó a un letrado que había incluido en una demanda de amparo citas entrecomilladas de diecinueve sentencias del propio Tribunal que no se correspondían con su contenido real. Y en Navarra, una abogada que citó resoluciones inexistentes del TC, del Supremo y de dos TSJ se libró de la multa por rectificar y disculparse de inmediato.

Fíjese en un detalle importante del caso canario: el letrado no usaba una herramienta gratuita ni de juguete. El auto habla de «una herramienta de inteligencia generativa con suscripción de pago». La potencia del modelo no era el problema. La ausencia de fuente lo era.
Cómo se usa un modelo así sin acabar en un auto#
La solución no es renunciar a la IA —el propio tribunal reconoce su potencial y cita el Libro Blanco sobre Inteligencia Artificial y Abogacía del Consejo General de la Abogacía Española y el ICAV—. La solución es cambiar de dónde salen los datos.
Es justo el flujo para el que construimos Jurisprudenciator: el modelo no recuerda la sentencia, la lee. Busca en la jurisprudencia oficial española —Tribunal Supremo, Audiencia Nacional, TSJ, Audiencias Provinciales y juzgados—, devuelve el párrafo exacto y el ECLI, y usted comprueba antes de citar. Ese auto del TSJ de Canarias que aparece más arriba, con su ponente y su cifra, no lo he escrito de memoria: lo he buscado y leído con la herramienta mientras redactaba este artículo. Puede verificar el identificador ahora mismo.
Entonces, ¿merece la pena Claude Opus 5?#
Sí, y por una razón que no es la del titular: iguala o supera a modelos que cuestan el doble. Para un despacho que ya paga por IA, la pregunta relevante no es si Opus 5 es el número uno absoluto —según qué índice mire, no lo es—, sino si le da más trabajo útil por euro. Ahí la respuesta es clara.
Pero el salto de calidad de su despacho no vendrá del modelo. Vendrá de la fuente que le ponga delante. Un modelo mediocre con acceso a la base oficial le dará una cita verificable. El mejor modelo del mundo sin fuente le dará cuarenta y ocho citas preciosas, y una multa.
Fuentes y método#
Un artículo que critica cifras sin fuente no puede ir sin fuentes. Así se ha hecho este:
- Datos del modelo. Precios, niveles de esfuerzo y los resultados de Frontier-Bench, CursorBench, AutomationBench y OSWorld proceden del anuncio oficial de Anthropic (24 de julio de 2026).
- ARC-AGI verificado aparte. Las puntuaciones de ARC-AGI-1, 2 y 3 están tomadas de la ficha pública de resultados de ARC Prize, que las mide de forma independiente. No son cifras del fabricante.
- Comparativas de precio y rivales. El desglose frente a Fable 5 y GPT-5.6 Sol procede del análisis de Vellum.
- El contrapunto. El dato de que Opus 5 queda por detrás en capacidad agregada sale del Epoch Capabilities Index, y el techo de rendimiento en esfuerzo medio, de los análisis independientes publicados tras el lanzamiento.
- La resolución judicial. El auto del TSJ de Canarias se ha localizado y leído en la base oficial de jurisprudencia mientras se escribía este artículo. Se identifica por su ECLI —
ECLI:ES:TSJICAN:2026:1A— precisamente para que usted no tenga que fiarse de mí: búsquelo.
Pruébalo con un caso real
Pídele a tu IA la sentencia que necesitas.Con su ECLI, verificable.
Jurisprudenciator busca en la jurisprudencia oficial española y te devuelve el párrafo exacto, con el identificador de la resolución para que puedas comprobarla antes de citarla. Sin tarjeta.



