Benchmarks

Opus 5 empata con Sol; Terra, como Fable a un cuarto del coste

Sol, Terra, Opus 5 y Fable 5 sobre el mismo agente: empate técnico arriba, la misma puntuación a un cuarto del coste y niveles de esfuerzo que restan.

En esta página
  1. La alineación: precios, ventanas y niveles de esfuerzo
  2. ¿Qué compra realmente más esfuerzo?
  3. ¿Quién gana cuando el agente es idéntico?
  4. ¿Un maintainer fusionaría esto de verdad?
  5. Los tableros de especialista: comprensión, tests, refactorización
  6. Terminales, máquinas virtuales y la cola difícil
  7. ¿Cómo hay que leer un leaderboard de 2026?
  8. ¿Qué modelo recibe qué trabajo?

Ningún modelo gana el desarrollo de software en julio de 2026. En DeepSWE de Datacurve, el único tablero grande que pasa todos los modelos por el mismo agente, Claude Opus 5 marca un 74 % y GPT-5.6 Sol un 73 %, con barras de error que se solapan [1]. GPT-5.6 Terra iguala el 70 % de Claude Fable 5 por menos de un cuarto del coste [1]. Lo que separa a los cuatro es el perfil, no el puesto.

Uso los modelos Claude y Sol contra repositorios reales cada semana; a Terra solo lo conozco por los tableros de abajo. Así que esta es la comparación que quería que alguien escribiera para mí: los dos ChatGPT más fuertes contra los dos Claude más fuertes, benchmark a benchmark, incluida la parte que los hilos de lanzamiento se saltan, qué puede significar cada número y qué no.

La alineación: precios, ventanas y niveles de esfuerzo

Los cuatro modelos se reparten limpiamente por rol. OpenAI enruta el alias gpt-5.6 a Sol, “el modelo para la capacidad insignia”, y posiciona a Terra como el modelo que “equilibra inteligencia y coste” [2] [3]. Los docs de Anthropic apuntan Opus 5 a la programación agéntica compleja y el trabajo de empresa, y Fable 5, el tope de gama, a los agentes de larga duración [4].

Los precios de lista cuentan la misma historia. Sol cuesta 5 $ por millón de tokens de entrada y 30 $ por la salida; Terra exactamente la mitad, 2,50 $ y 15 $ [2]. Opus 5 está en 5 $ y 25 $, Fable 5 en 10 $ y 50 $ [5]. Y la prima de Anthropic sigue subiendo desde ahí: la página de precios lista un fast mode para Opus 5, en vista previa de investigación, exactamente a las tarifas de Fable [5].

Especificación SolTerraOpus 5Fable 5
Entrada, $/MTok 5,00 2,50 (El mejor valor de la fila) 5,00 10,00
Salida, $/MTok 30 15 (El mejor valor de la fila) 25 50
Lectura de caché, $/MTok 0,50 0,25 (El mejor valor de la fila) 0,50 1,00
Ventana de contexto 1,05M 1,05M 1M 1M
Niveles de esfuerzo 6, de none a max 6, de none a max 5, de low a max 5, de low a max
Figura 1. Precios de lista y especificaciones de los cuatro modelos. Docs de desarrollador de OpenAI y Anthropic, julio de 2026.

La tabla en una línea: Terra es el único descuento de la sala, y las ventanas de contexto son tan parecidas que dejan de diferenciar [2] [4].

Los diales de esfuerzo merecen más atención que los precios. GPT-5.6 acepta seis valores, de none a max, y la guía de OpenAI llama a medium el punto de partida equilibrado [3]. Los modelos Claude aceptan cinco, de low a max, traen high por defecto, y Anthropic te dice que subas Opus 5 a xhigh para trabajo agéntico y de programación exigente, y que reserves max para tareas que justifiquen un gasto de tokens sin restricciones [6]. Nada garantiza que el high de OpenAI y el high de Anthropic compren un cómputo comparable. Los nombres de esfuerzo son mandos de cada vendedor, no unidades.

¿Qué compra realmente más esfuerzo?

De diez a quince puntos de inteligencia medida, por entre ocho y dieciséis veces los tokens. Artificial Analysis puntúa a Opus 5 desde 51 en esfuerzo low hasta 61 en max, a Sol de 49 a 59 y a Terra de 40 a 55 en su Intelligence Index [9] [10] [11].

Ese índice, v4.1, mezcla nueve evaluaciones, del trabajo agéntico en terminal y la ejecución de tareas reales a GPQA Diamond y el razonamiento de contexto largo, ponderadas 34 % agentes, 24 % programación, 24 % razonamiento científico y 18 % general [12]. Es la mejor foto pública de la curva de esfuerzo, porque la misma batería corrió en todos los ajustes.

  • Opus 5
  • Sol
  • Terra
Intelligence Index por nivel de esfuerzo para Opus 5, Sol y Terra Opus 5 lidera en todos los ajustes, Sol le sigue a dos puntos y Terra queda atrás pero es quien más sube, de 40 a 55. 30 40 50 60 70 low medium high xhigh max
Ver los datos en una tabla
Esfuerzo Opus 5SolTerra
low 514940
medium 565446
high 595649
xhigh 605852
max 615955
Figura 2. Intelligence Index v4.1 por nivel de esfuerzo. Artificial Analysis, consultado el 30 de julio de 2026.

Dos cosas saltan a la vista en la figura 2. Las curvas apenas se cruzan, así que el orden sobrevive a cualquier ajuste. Y la cima es plana: el salto impreso de Opus 5 de 60 a 61 son 0,62 puntos de índice sin redondear, comprados subiendo la factura de salida de la batería de 76 a 100 millones de tokens [9].

Las facturas de tokens son la curva de verdad. Opus 5 gastó 12 millones de tokens de salida en la batería a low y 100 millones a max; Sol fue de 6,6 a 70 millones; Terra de 5,9 a 96 [9] [10] [11]. El último escalón de Terra es el caro: de xhigh a max casi triplica sus tokens por tres puntos de índice [11].

Fable 5 no tiene barrido público de esfuerzo. Artificial Analysis lista exactamente una configuración, max, con 60, un punto redondeado por debajo de Opus 5, generada con 87 millones de tokens [13]. Los dos buques insignia de Anthropic corrieron con fallback en servidor a Opus 4.8 para los prompts que su capa de seguridad detiene [13] [14]. El veredicto de lanzamiento de AA sobre Opus 5 resume esta sección: inteligencia de nivel Fable a 2,03 $ por tarea del índice frente a los 2,75 $ de Fable [14].

¿Quién gana cuando el agente es idéntico?

Nadie, y ese es el hallazgo. DeepSWE pasa los 18 modelos por el mismo mini-swe-agent, y a esfuerzo máximo Opus 5 resuelve el 74 % ± 4 de las tareas y Sol el 73 % ± 3 [1]. Los intervalos se solapan de sobra. Fable 5 y Terra quedan igualados en el 70 % [1].

DeepSWE es la comparación en la que más confío porque elimina la variable del harness. Sus 113 tareas cubren 91 repositorios y cinco lenguajes, están escritas desde cero para que ningún modelo viera una solución durante el entrenamiento, y las califican verificadores escritos a mano que prueban comportamiento, no detalles de implementación [1]. Los prompts miden la mitad que los de SWE-bench Pro y las soluciones necesitan 5,5 veces más código [1].

Medición Opus 5SolFable 5Terra
Tareas resueltas, % 74 73 70 70
Coste por tarea, $ 11,84 8,39 21,63 4,95 (El mejor valor de la fila)
Tokens de salida, K 118 60 (El mejor valor de la fila) 119 72
Pasos del agente 99 61 (El mejor valor de la fila) 88 76
Figura 3. DeepSWE v1.1 a esfuerzo máximo, el mismo mini-swe-agent para todos los modelos. Datacurve, actualizado el 25 de julio de 2026.

La fila de resueltas en la figura 3 va sin marcar a propósito: 74 ± 4 contra 73 ± 3 es un empate, y el propio Datacurve avisa de que las configuraciones punteras “a menudo se solapan en los intervalos de confianza” [1]. Las otras filas sí separan. Sol llegó al mismo resultado con la mitad de tokens de salida, en 61 pasos frente a los 99 de Opus 5, a 8,39 $ por tarea contra 11,84 $ [1]. Opus investiga más rato. Sol entrega antes.

Terra es la fila que reprecia el mercado: el mismo 70 % que Fable 5 a 4,95 $ por tarea intentada frente a 21,63 $ [1]. Divide el coste por intento entre la tasa de resolución, el suelo optimista que usé con los números de Kimi K3, y una tarea resuelta cuesta 7,07 $ en Terra y 30,90 $ en Fable.

tareas resueltas a esfuerzo máximo
70 %
igualado con Fable 5 max
medido, por tarea intentada
4,95 $
Fable 5 max: 21,63 $
derivado, por tarea resuelta
7,07 $
el más barato de los cuatro a max
Figura 4. Qué significa en dinero la fila de Terra en DeepSWE. Costes medidos de Datacurve; la cifra por resuelta es aritmética mía.

De todas formas, max casi nunca es el ajuste racional en este tablero. Opus 5 a esfuerzo high mantiene el 73 % ± 2 a 6,08 $, igualando a Sol max por menos dinero; Sol a xhigh mantiene el 71 % ± 1 a 4,70 $, el intervalo más estrecho cerca de la cima [1]. Fable nunca supera aquí a su versión más barata: xhigh saca el mismo 70 % que max a 13,41 $ en vez de 21,63 $ [1]. La propia frontera coste-puntuación de Datacurve marca como configuraciones eficientes Opus 5 a max, Fable 5 a high y Sol a medium [1].

¿Un maintainer fusionaría esto de verdad?

FrontierCode de Cognition pregunta exactamente eso, y reordena el campo. Las tareas las escriben maintainers de los repositorios bajo prueba, las ejecuciones que consultan fuentes con la solución puntúan cero, y la calificación cubre corrección, calidad de los tests, alcance y convenciones del código [15]. Las mejores configuraciones: Fable 5 xhigh con 53,5, Opus 5 medium con 53,4, Sol max con 47,5, Terra max con 41,3 [15].

Vuelve a leer esa lista. La mejor calidad de parche de Opus 5 sale de su segundo ajuste de esfuerzo más bajo.

  • Fable 5
  • Opus 5
  • Sol
Puntuación de FrontierCode por nivel de esfuerzo para Fable 5, Opus 5 y Sol Sol sube con cada escalón hasta 47,5, Fable 5 hace pico en xhigh con 53,5, Opus 5 hace pico en medium con 53,4 y cae a 43,6 en xhigh. 30 40 50 60 low medium high xhigh max
Ver los datos en una tabla
Esfuerzo Fable 5Opus 5Sol
low 48,041,935,4
medium 49,853,439,9
high 52,748,045,1
xhigh 53,543,646,8
max 51,648,047,5
Figura 5. FrontierCode 1.1, conjunto principal, por nivel de esfuerzo. Datos del leaderboard de Cognition, julio de 2026.

La figura 5 es el gráfico más útil que encontré en toda la semana. Sol sube con cada paso del dial, de 35,4 a 47,5, así que más esfuerzo le compra a Sol un parche mejor de forma fiable [15]. Fable hace pico en xhigh y devuelve 1,9 puntos en max [15]. Opus 5 hace pico en medium con 53,4, cae a 43,6 en xhigh y solo se recupera a medias en max [15]. La system card de Anthropic imprime la misma curva y declara el ancla ella misma: mejor puntuación del conjunto principal en medium [16].

El mecanismo se ve en la calificación. FrontierCode puntúa la disciplina de alcance [15] y comprueba patrones de implementación prohibidos [16], y más esfuerzo hace que un modelo explore más, toque más, amplíe más. En un banco de investigación abierto, esa es la gracia. Dentro de una pull request acotada, se lee como alcance inflado. Es la versión en benchmark de lo que escribí cuando Opus 5 llevó mi semana: un gran empleado cuyo jefe no deja de asignarse trabajo extra.

Dos notas al pie antes de coronar a Fable. La ventaja de 0,1 puntos sobre Opus 5 medium abarca cinco ejecuciones por configuración y tasas de aprobado idénticas del 58,9 %, así que es ruido; los costes no lo son, con 13,09 $ por rollout para Fable xhigh frente a 4,30 $ para Opus medium [15]. Y hasta el mejor Sol queda por debajo del peor Fable: 47,5 contra 48,0 en low [15]. En calificación de calidad de merge, la pila Claude lidera sin discusión, con la salvedad de siempre: Claude corrió en Claude Code y GPT-5.6 en Codex [15].

Los tableros de especialista: comprensión, tests, refactorización

La familia SWE Atlas de Scale mide lo que una tasa de resolución esconde, y es donde los cuatro perfiles más se separan.

Codebase QnA entrega al agente un repositorio real en un contenedor y 124 preguntas que exigen ejecutar el software y trazar la ejecución, cargadas hacia arquitectura (35 %) y análisis de causa raíz (30 %) [17]. Scale Labs puntúa a Sol a xhigh en Codex con 46,0 ± 5,0, a Fable 5 con 39,0 ± 5,0 en Claude Code, y anota que ambos modelos rechazaron preguntas benignas que activaron filtros de seguridad, con los rechazos puntuados como cero [17]. Ni Opus 5 ni Terra tienen fila. El tablero entero lo corona la generación anterior: Opus 4.8 con 57,26 [17].

Ejecutadas por otro laboratorio, las mismas 124 preguntas se dan la vuelta. Dentro del Coding Agent Index de Artificial Analysis, Opus 5 xhigh saca la mejor componente SWE-Atlas-QnA con 54,8, por delante del 48,9 de Fable, con Sol max en 43,3 [18]. Mismo conjunto de tareas, ejecuciones distintas, orden opuesto. Guarda ese dato para la siguiente sección.

Test Writing es el ingenioso: 90 tareas donde los tests generados deben pasar contra la implementación real y fallar cuando el código relevante se muta, así que los tests vacíos no puntúan nada [19]. Fable 5 lidera con 55,6 ± 5,8 frente al 45,9 ± 6,0 de Sol, aunque el ranking por intervalos del tablero aún lista a ambos en el puesto 1 [19].

  • Fable 5
  • Sol
Puntuaciones de SWE Atlas en Codebase QnA y Test Writing Sol lidera la comprensión de código 46,0 a 39,0, Fable 5 lidera la escritura de tests 55,6 a 45,9. Codebase QnA 39,0 46,0 Test Writing 55,6 45,9
Ver los datos en una tabla
Benchmark Fable 5Sol
Codebase QnA 39,046,0
Test Writing 55,645,9
Figura 6. Puntuaciones de SWE Atlas, Fable 5 (Claude Code, xhigh) contra Sol (Codex, xhigh). Scale Labs, 28 de julio de 2026.

Los dos tableros de la figura 6 apuntan en direcciones opuestas, y ese es el perfil en miniatura: en la ejecución de Scale, Sol lee un sistema desconocido algo mejor y Fable lo testea bastante mejor.

Refactorización es la victoria más clara de Fable: 54,76 ± 6,76, primero de un tablero cuyas 70 tareas cubren descomposición, evolución de interfaces, extracción y reubicación, y cuyos calificadores buscan regresiones, call sites rotos, dependencias circulares y código muerto olvidado [20]. No existe fila de Opus 5, Sol ni Terra; la mejor configuración GPT listada es el GPT-5.5 de la generación anterior con 44,79 [20]. Una fila ausente no es un cero. Pero el resultado vigente es de Fable.

Terminales, máquinas virtuales y la cola difícil

Terminal-Bench 2.1 mide si un modelo puede llevar una shell a un estado final verificado, y la cima es una foto finish. En la ejecución independiente de Artificial Analysis, Sol a xhigh lidera con el 89,5 %, Opus 5 max marca el 89,1 % y tres configuraciones, Sol max, Terra max y Opus 5 xhigh, caen en un 88,0 % idéntico [21]. Con 89 tareas y tres repeticiones [12], un solo intento volteado mueve la puntuación unos 0,4 puntos. Fable 5 queda en el 84,6 % [21].

Puntuaciones de Terminal-Bench v2.1, mejor configuración por modelo Sol xhigh lidera con 89,5 por ciento, Opus 5 max con 89,1, Terra max con 88,0 y Fable 5 max con 84,6. Sol xhigh 89,5 % Opus 5 max 89,1 % Terra max 88,0 % Fable 5 max 84,6 %
Ver los datos en una tabla
Configuración Valor
Sol xhigh 89,5 %
Opus 5 max 89,1 %
Terra max 88,0 %
Fable 5 max 84,6 %
Figura 7. Terminal-Bench v2.1, mejor configuración por modelo. Artificial Analysis, consultado el 30 de julio de 2026.

La lectura de la figura 7: la corona del terminal es un error de redondeo repartido entre tres modelos, y Fable es el único visiblemente rezagado. Fíjate en que Terra aguanta el ritmo de los buques insignia aquí, a 2,50 $ por millón de tokens de entrada [2] [21]. La propia tabla de lanzamiento de OpenAI cuenta una historia parecida con otros dígitos, Sol 88,8 %, Terra 87,4 %, Fable 5 83,1 % [7], y el desacuerdo entre ejecuciones propias e independientes es más o menos del tamaño de las diferencias que se discuten.

FrontierBench v0.1 es el sucesor, del mismo equipo: 74 tareas más duras inclinadas hacia biología computacional, simulación física, CAD, demostraciones formales y rendimiento de GPU [16]. Anthropic lo corrió sobre mini-swe-agent y reporta a Opus 5 con el 44,4 % a esfuerzo xhigh, su mejor marca, con max dentro del ruido en el 43 % y high alcanzando el 39 % con un 19 % menos de tokens de salida; Sol queda en el 37,5 % y Fable 5 en el 33,7 %, ambos a max [16]. En problemas genuinamente abiertos, Opus 5 lidera a los cuatro con claridad.

Dos tableros vecinos completan la cola agéntica. En OSWorld 2.0, donde el modelo maneja una máquina virtual Ubuntu real con ratón y teclado durante hasta 500 acciones por tarea, Opus 5 saca el 70,6 %, Fable 5 el 66,1 % y Sol el 62,6 %, con la cifra de Sol tomada del propio post de lanzamiento de OpenAI [16]. En AutomationBench de Zapier, una empresa simulada con 47 aplicaciones y políticas de negocio en capas, Opus 5 max saca el 26,0 % y Opus 5 medium el 24 % a 0,89 $ por tarea, frente al 18,1 % de Sol y el 17,4 % de Fable [16]. Cuanto más sucio y más atado a herramientas es el entorno, más se despega Opus. Y medium sigue dejando en evidencia a max.

¿Cómo hay que leer un leaderboard de 2026?

Como la medición de un modelo llevando un agente concreto a un esfuerzo concreto bajo un calificador concreto. Cambia cualquiera de los tres y el número se mueve, a veces más que la distancia entre el primero y el cuarto puesto. Cinco hábitos mantienen la lectura honesta.

El hábitoLa prueba en esta comparación
Pregunta qué harness corrióSWE-bench Pro lee Fable 80,0, Opus 5 79,2, Sol 64,6, cada vendedor con su propio agente [16]; el agente compartido de DeepSWE comprime los mismos modelos en cuatro puntos [1]
Respeta las barras de error74 ± 4 contra 73 ± 3 [1]; tres empates exactos en el 88,0 % [21]; una ventaja de 0,1 puntos sobre cinco ejecuciones [15]
Detecta la saturaciónOpus 5 saca el 96,0 % en SWE-bench Verified [16]; un tablero sin techo no ordena nada
Comprueba la versiónLa página de lanzamiento de OpenAI cita el Coding Agent Index v1.1 con Sol en 80 [7]; el v1.3 vivo puntúa a Sol max con 67 [18]
Ausente no es ceroOpus 5 no tiene fila en ninguno de los tres tableros de Scale [17] [19] [20]; Terra apenas existe fuera de DeepSWE y FrontierCode

La fila de la versión merece una frase más, porque es la más traicionera. Un 80 en v1.1 y un 67 en v1.3 describen la misma familia de modelos en el índice del mismo nombre y no son comparables en absoluto; DeepSWE recalificó igual a GPT-5.5 xhigh del 70 % al 67 % entre sus conjuntos v1 y v1.1 [1]. Un nombre de benchmark sin número de versión es una sensación.

Hasta las fuentes primarias cojean. La tabla resumen de la system card de Opus 5 etiqueta la ejecución de Sol en FrontierBench como Codex mientras su texto de métodos dice mini-swe-agent sobre la misma infraestructura, y el documento no resuelve la contradicción [16]. Su victoria en SWE-bench Multimodal, 59,4 contra 54,1 de Fable, sale de un harness interno modificado a partir del público [16]. Scale, por su parte, concede a las filas nuevas de mini-swe-agent 500 pasos donde las anteriores tuvieron 250, y observa que los modelos frontera simplemente rinden mejor en sus scaffolds nativos [17]. Nada de esto es fraude. Es lo que parece medir un sistema en movimiento, y por eso el examen del hype de Kimi K3 y GLM-5.2 llegó a la misma conclusión desde otros datos: las afirmaciones de capacidad sobreviven al escrutinio, las de comparabilidad casi nunca.

¿Qué modelo recibe qué trabajo?

Terra para el volumen rutinario, Sol para objetivos conocidos, Opus 5 para problemas desconocidos, Fable 5 para cambios que deben fusionarse limpios. Eso es lo que suman los perfiles de arriba, y el ajuste de esfuerzo importa tanto como el nombre del modelo.

El trabajoMi elecciónEsfuerzo
Endpoints rutinarios, mappings, tests pequeños, configTerramedium o high
Una pull request acotada con criterios de aceptación clarosOpus 5medium
Implementar un plan conocido, arreglar un bug reproducibleSolhigh
Buscar la causa raíz de un fallo desconocidoOpus 5high o xhigh
Estrategia de tests para una feature que importaFable 5xhigh
Refactorización a escala de repo y migraciones de interfacesFable 5xhigh
Sesiones largas de terminal y depuraciónSol u Opus 5high o xhigh
Ingeniería abierta sin solución conocidaOpus 5xhigh

Ninguno de estos tableros corrió mi stack, y ninguno corrió el tuyo, así que la tabla es una inferencia desde los perfiles, no una medición. Las reglas de esfuerzo sí están medidas. Sol es el único de los cuatro cuya calidad de merge subió con cada paso del dial [15]. Fable toca techo en xhigh en los tableros que lidera [15] [19]. Opus 5 quiere el dial a juego con el trabajo: medium para un cambio acotado [15], xhigh cuando el problema está genuinamente abierto [16]. Los docs de ambos vendedores coinciden con sus curvas: OpenAI llama a medium el punto de partida equilibrado [3], Anthropic trae high por defecto y trata max como la excepción que debe justificar su factura de tokens [6].

Tres resultados redibujarían esta tabla: una fila de Opus 5 en los tableros de Scale, un barrido público de esfuerzo para Fable 5 y cualquiera de estos cuatro medido en el harness del otro vendedor. Hasta entonces, compra el perfil, no el puesto. El modelo más caro de esta comparación no es el mejor en la mayoría de los trabajos, el más barato queda vergonzosamente cerca en la mitad, y el cambio de configuración más valioso no cuesta nada: bajar el dial de esfuerzo.

Fuentes

  1. DeepSWE leaderboardDatacurve · 2026-07-25
  2. API modelsOpenAI Developers
  3. Latest model guideOpenAI Developers
  4. Models overviewClaude Platform Docs
  5. PricingClaude Platform Docs
  6. EffortClaude Platform Docs
  7. GPT-5.6OpenAI
  8. Codex modelsChatGPT Docs
  9. Claude Opus 5 analysisArtificial Analysis
  10. GPT-5.6 Sol analysisArtificial Analysis
  11. GPT-5.6 Terra analysisArtificial Analysis
  12. Intelligence benchmarking methodologyArtificial Analysis
  13. Claude Fable 5 analysisArtificial Analysis
  14. Opus 5: Fable 5 level intelligence at a lower cost per taskArtificial Analysis · 2026-07-24
  15. FrontierCode leaderboardCognition · 2026-07-07
  16. Claude Opus 5 system cardAnthropic on alphaXiv · 2026-07-24
  17. SWE Atlas: Codebase QnAScale Labs · 2026-07-28
  18. Coding Agent IndexArtificial Analysis
  19. SWE Atlas: Test WritingScale Labs · 2026-07-28
  20. SWE Atlas: RefactoringScale Labs
  21. Terminal-Bench v2.1 evaluationArtificial Analysis