
GPT-6 Sol y Luna: la mejora está sobre todo en el precio
GPT-6 Sol y Luna bajan los precios de la API, con avances menores en los tests. Comparo resultados, acceso en ChatGPT y primeras experiencias en Reddit.
Todos los artículos con la etiqueta benchmarks, del más reciente al más antiguo.

GPT-6 Sol y Luna bajan los precios de la API, con avances menores en los tests. Comparo resultados, acceso en ChatGPT y primeras experiencias en Reddit.

Opus 5.5 mejora en pruebas independientes y baja el precio de los tokens. Comparo el coste por tarea, el esfuerzo y las primeras experiencias en Reddit.

GPT-6 Astra gasta tu cuota 2,5 veces más rápido por token que Sol. Revisé los límites de cada plan, los benchmarks y las primeras reacciones de la comunidad.

Muse Spark 1.3 sacó 62 en Artificial Analysis, por encima de GPT-6 Astra, y cayó al noveno puesto al recalcular el índice. Revisé de dónde salía y qué cuesta.

Fable 5.1 mejora a su antecesor en tareas largas con agentes, pero Opus 5 se mantiene cerca y cuesta la mitad. Revisé benchmarks e informes iniciales.

V4 Flash cuesta 0,14 dólares de entrada y 0,28 de salida por millón de tokens. Analizo si el descuento del 97 al 99 % compensa sus nueve derrotas.

DeepSWE sitúa a Luna Max 2,2 puntos por detrás de Sol High con casi una sexta parte del coste. Explico por qué se sienten distintos en un repositorio.

Comparé Sol, Terra, Opus 5 y Fable 5 en benchmarks de código. El ganador cambia según la tarea, el nivel de esfuerzo, el agente y el presupuesto.

Kimi K3 iguala a GPT-5.6 medium, pero tarda 4,6 veces más. GLM-5.2 es barato por token y caro por tarea. Compruebo en qué sigue destacando cada uno.

Opus 5 iguala a Fable 5 en benchmarks a mitad de precio por token, pero supervisarlo puede ser agotador. Explico cuándo Fable aún merece su lugar.