JurisprudenciatorJurisprudenciatorby Derecho Virtual

Claude Opus 5 para abogados: qué dicen sus benchmarks (y qué no miden)

Opus 5 triplica al siguiente modelo en el test que mide razonamiento nuevo y cuesta la mitad que su rival directo. Pero ninguna de sus cifras responde a la única pregunta que le importa a un abogado: ¿se va a inventar la sentencia?

CCarlos RiveroCEO de Derecho Virtual·9 min de lectura·1880 palabras
Ilustración de los benchmarks de Claude Opus 5 sobre una balanza de la justicia
Los benchmarks de Claude Opus 5 miden inteligencia general. La deontología mide otra cosa.

Anthropic presentó Claude Opus 5 el 24 de julio de 2026 y, tres semanas después, medio sector jurídico sigue repitiendo una cifra que casi nadie ha mirado de cerca: triplica al siguiente modelo en la prueba diseñada para medir inteligencia de verdad. Es cierto. Y también es, para un despacho, casi irrelevante. Este artículo separa las dos cosas: lo que los benchmarks de Opus 5 demuestran, y la única pregunta que ninguno de ellos responde.

Qué es Claude Opus 5 y qué ha presentado Anthropic#

Claude Opus 5 es el modelo insignia de Anthropic y llega con una decisión comercial poco habitual: no sube de precio. Se mantiene en 5 dólares por millón de tokens de entrada y 25 por millón de salida, exactamente lo mismo que Opus 4.8, mientras que su competidor de gama alta, Fable 5, se sitúa en 10 y 50 dólares respectivamente.

Las cifras que importan

30,2 %ARC-AGI-3Anterior récord: 7,8 %
43,3 %Frontier-Bench v0.1Opus 4.8: 18,7 %
97,5 %ARC-AGI-1 (esfuerzo máx.)Verificado por ARC Prize
5 $ / 25 $Coste por millón de tokensFable 5: 10 $ / 50 $

La prueba que ha dado el titular es ARC-AGI-3, un test que presenta problemas visuales que el modelo no ha podido ver durante su entrenamiento. Es lo más parecido que existe hoy a medir si una máquina razona en lugar de recordar. Y ahí la distancia no es de matiz:

ARC-AGI-3: puntuación por modelo
Claude Opus 530,2 %
GPT-5.6 Sol7,8 %
Claude Opus 4.81,5 %

En las dos generaciones anteriores del mismo test, verificadas de forma independiente por ARC Prize, el modelo alcanza un 97,5 % en ARC-AGI-1 y un 90,4 % en ARC-AGI-2 con esfuerzo máximo. Son cifras de saturación: esas pruebas han dejado de discriminar.

Traducido al trabajo de un despacho#

Un abogado no contrata un modelo por su puntuación en rompecabezas visuales. Lo que sí se traduce es otra cosa: la capacidad de encadenar pasos sin supervisión. Es la diferencia entre pedirle un resumen y pedirle que busque, contraste, descarte y redacte.

PruebaQué mide en realidadResultado de Opus 5
ARC-AGI-3Razonar ante un problema nunca visto30,2 %, triple que el siguiente
Frontier-Bench v0.1Tareas complejas de extremo a extremo43,3 %, más del doble que Opus 4.8
Zapier AutomationBenchAutomatizar flujos reales de trabajo~1,5× el siguiente modelo, a igual coste
OSWorld 2.0Manejar un ordenador como un usuarioSupera a Fable 5 por un tercio de su coste
CursorBench 3.2Programación asistidaA menos de 0,5 puntos de Fable 5, a mitad de precio

Traducido: para un despacho que quiera montar flujos —revisar una carpeta de contratos, cruzar veinte escritos, preparar un cuadro de plazos— este modelo hace en una pasada lo que antes exigía trocear en diez peticiones. Ese es el salto real, y no la cifra de titular.

La letra pequeña que casi nadie cuenta#

Aquí es donde conviene bajar el entusiasmo dos puntos, porque hay tres matices que los titulares se saltaron.

Más esfuerzo no siempre es mejor#

Claude Opus 5 se puede ajustar en cuatro niveles de razonamiento (bajo, medio, alto y máximo). Lo intuitivo sería dejarlo siempre al máximo. Pues bien: en las evaluaciones de código de frontera el rendimiento hace techo en esfuerzo medio, en torno al 53 %, y empeora al subir de ahí, además de costar más. Es un comportamiento contraintuitivo y una invitación clarísima a medir con sus propias tareas antes de fijar la configuración.

El esfuerzo de razonamiento de Claude Opus 5 tiene un punto óptimo: pasado ese punto, rinde peor y cuesta más
Subir el esfuerzo de razonamiento al máximo no siempre mejora el resultado: en algunas tareas empeora y siempre encarece.

No gana en todos los marcadores#

El Epoch Capabilities Index, que agrega resultados de muchas pruebas en un solo número, coloca a Opus 5 por detrás de Fable 5 y GPT-5.6 en capacidad agregada. Y GPT-5.6 Sol sigue por delante en algunos benchmarks de programación consolidados. La conclusión honesta no es «Opus 5 es el mejor modelo», sino «Opus 5 es el mejor en razonamiento nuevo y en relación capacidad-precio».

Un benchmark no es su despacho#

Todas estas pruebas se ejecutan en inglés, sobre tareas de programación, ciencia o manejo de escritorio. Ninguna incluye un recurso de suplicación, un cuadro de plazos procesales ni la búsqueda de una doctrina consolidada del Tribunal Supremo. La transferencia existe, pero no es automática.

Los benchmarks miden si el modelo es inteligente. No miden si le va a mentir con cara de seguridad.

Lo que ninguna cifra mide: si se inventa la jurisprudencia#

Este es el punto que separa una conversación de tecnología de una conversación profesional. Un modelo de lenguaje, por brillante que sea, genera texto plausible. Si le pregunta por una sentencia y no tiene delante la fuente, producirá una cita con estructura perfecta —sala, fecha, número de recurso, ponente, párrafo entrecomillado— que puede no existir.

No es un riesgo teórico. Es un riesgo tasado, con importe.

Merece la pena leer cómo razona la Sala el importe, porque es de una ironía perfecta. El tribunal parte del coste de una suscripción profesional a una herramienta de IA jurídica —unos 70 euros al mes, 840 euros al año— y lo toma como referencia de la multa. Después la rebaja a la mitad, hasta los 420 euros, porque el letrado admitió los hechos y se apuntó a un curso de competencias digitales del Consejo General de la Abogacía. Dicho de otro modo: le multaron con lo que habría costado hacerlo bien.

El auto también recuerda los precedentes. El acuerdo del Tribunal Constitucional de 9 de septiembre de 2023 sancionó a un letrado que había incluido en una demanda de amparo citas entrecomilladas de diecinueve sentencias del propio Tribunal que no se correspondían con su contenido real. Y en Navarra, una abogada que citó resoluciones inexistentes del TC, del Supremo y de dos TSJ se libró de la multa por rectificar y disculparse de inmediato.

Verificar el ECLI de una resolución antes de citarla es lo único que distingue una cita real de una alucinación de la IA
El ECLI es el identificador europeo de cada resolución: sin él, una cita no se puede comprobar.

Fíjese en un detalle importante del caso canario: el letrado no usaba una herramienta gratuita ni de juguete. El auto habla de «una herramienta de inteligencia generativa con suscripción de pago». La potencia del modelo no era el problema. La ausencia de fuente lo era.

Cómo se usa un modelo así sin acabar en un auto#

La solución no es renunciar a la IA —el propio tribunal reconoce su potencial y cita el Libro Blanco sobre Inteligencia Artificial y Abogacía del Consejo General de la Abogacía Española y el ICAV—. La solución es cambiar de dónde salen los datos.

Es justo el flujo para el que construimos Jurisprudenciator: el modelo no recuerda la sentencia, la lee. Busca en la jurisprudencia oficial española —Tribunal Supremo, Audiencia Nacional, TSJ, Audiencias Provinciales y juzgados—, devuelve el párrafo exacto y el ECLI, y usted comprueba antes de citar. Ese auto del TSJ de Canarias que aparece más arriba, con su ponente y su cifra, no lo he escrito de memoria: lo he buscado y leído con la herramienta mientras redactaba este artículo. Puede verificar el identificador ahora mismo.

Buscar una sentencia y comprobar su ECLIGratis, sin tarjeta. Funciona dentro de ChatGPT y de Claude.

Entonces, ¿merece la pena Claude Opus 5?#

Sí, y por una razón que no es la del titular: iguala o supera a modelos que cuestan el doble. Para un despacho que ya paga por IA, la pregunta relevante no es si Opus 5 es el número uno absoluto —según qué índice mire, no lo es—, sino si le da más trabajo útil por euro. Ahí la respuesta es clara.

Pero el salto de calidad de su despacho no vendrá del modelo. Vendrá de la fuente que le ponga delante. Un modelo mediocre con acceso a la base oficial le dará una cita verificable. El mejor modelo del mundo sin fuente le dará cuarenta y ocho citas preciosas, y una multa.

Fuentes y método#

Un artículo que critica cifras sin fuente no puede ir sin fuentes. Así se ha hecho este:

  1. Datos del modelo. Precios, niveles de esfuerzo y los resultados de Frontier-Bench, CursorBench, AutomationBench y OSWorld proceden del anuncio oficial de Anthropic (24 de julio de 2026).
  2. ARC-AGI verificado aparte. Las puntuaciones de ARC-AGI-1, 2 y 3 están tomadas de la ficha pública de resultados de ARC Prize, que las mide de forma independiente. No son cifras del fabricante.
  3. Comparativas de precio y rivales. El desglose frente a Fable 5 y GPT-5.6 Sol procede del análisis de Vellum.
  4. El contrapunto. El dato de que Opus 5 queda por detrás en capacidad agregada sale del Epoch Capabilities Index, y el techo de rendimiento en esfuerzo medio, de los análisis independientes publicados tras el lanzamiento.
  5. La resolución judicial. El auto del TSJ de Canarias se ha localizado y leído en la base oficial de jurisprudencia mientras se escribía este artículo. Se identifica por su ECLI —ECLI:ES:TSJICAN:2026:1A— precisamente para que usted no tenga que fiarse de mí: búsquelo.
Compartir

Pruébalo con un caso real

Pídele a tu IA la sentencia que necesitas.Con su ECLI, verificable.

Jurisprudenciator busca en la jurisprudencia oficial española y te devuelve el párrafo exacto, con el identificador de la resolución para que puedas comprobarla antes de citarla. Sin tarjeta.

Preguntas frecuentes

01¿Qué es Claude Opus 5?
Es el modelo insignia de Anthropic, presentado el 24 de julio de 2026. Su precio es de 5 dólares por millón de tokens de entrada y 25 por millón de salida, el mismo que su antecesor Opus 4.8, y ofrece cuatro niveles de esfuerzo de razonamiento (bajo, medio, alto y máximo).
02¿Es Claude Opus 5 mejor que GPT-5.6 Sol para trabajo jurídico?
Depende de la tarea. Opus 5 lidera con claridad los tests de razonamiento nuevo (30,2 % en ARC-AGI-3 frente al 7,8 % de GPT-5.6 Sol) y los de uso autónomo de herramientas, mientras que GPT-5.6 Sol sigue por delante en algunos benchmarks de programación consolidados. Para trabajo jurídico ninguno de esos números es determinante: lo que decide es si el modelo tiene acceso a una fuente oficial verificable.
03¿Puede Claude Opus 5 inventarse una sentencia?
Sí. Cualquier modelo de lenguaje puede generar una cita con formato impecable y contenido inexistente si responde de memoria. La única forma de evitarlo es que el modelo consulte una base oficial y devuelva el identificador de la resolución (el ECLI) para que usted pueda comprobarla antes de citarla.
04¿Qué nivel de esfuerzo conviene usar en Opus 5?
No siempre el máximo. En algunas evaluaciones de código el rendimiento hace techo en esfuerzo medio y empeora —además de encarecerse— al subirlo. Conviene medir con sus propias tareas antes de dejar el modelo fijado en máximo esfuerzo.
05¿Me pueden sancionar por citar una sentencia inventada por la IA?
Sí. El Tribunal Superior de Justicia de Canarias impuso una multa de 420 euros a un abogado que incluyó 48 citas falsas generadas por IA en un recurso (auto de 10 de febrero de 2026). Antes hubo apercibimientos del Tribunal Constitucional (2023) y del TSJ de Navarra, pero los tribunales ya consideran que la novedad del problema no sirve de excusa.
Novedad: Jurisprudenciator ya verifica normativa europea al instante
La mascota de Jurisprudenciator lee un tomo de normativa europea bajo un arco con las doce estrellas de la UniónNovedades

Novedad: Jurisprudenciator ya verifica normativa europea al instante

Desde hoy, Jurisprudenciator busca y verifica normativa europea: reglamentos, directivas y decisiones, en su versión consolidada, en español y con el párrafo literal en menos de un segundo. Tres casos reales de despacho.

Carlos Rivero7 min de lectura