Kimi K3 es real, GLM-5.2 es una apuesta, ninguno es ganga
Kimi K3 empata con GPT-5.6 en el índice independiente de código y tarda 4,6 veces más. Los tokens de GLM-5.2 a 1,40 $ salen a 6,51 $ por tarea. El hype, medido.
El discurso detrás de los nuevos modelos chinos es simple: pesos abiertos que igualan a la frontera occidental por una fracción del precio. Los números independientes son más concretos. En el Coding Agent Index de Artificial Analysis, Kimi K3 sí empata con el ajuste medium de GPT-5.6, con 4,6 veces el tiempo activo [1]. Y los tokens de GLM-5.2 a 1,40 $ se convirtieron en 6,51 $ por tarea intentada [2].
Todavía no he puesto ninguno de los dos modelos contra mis propios repositorios, así que esto no es una reseña práctica. Es una lectura de los recibos que existen: las mediciones independientes de agentes, los votos de las arenas, las tablas de los propios fabricantes con sus propias notas al pie, y los términos de licencia que nadie cita en los hilos de lanzamiento. Versión corta: la capacidad es real; el descuento, casi nunca.
¿De dónde sale el hype?
De tres hechos ciertos que llegaron a la vez. Kimi K3 lidera la clasificación fullstack de Arena [3] y es segundo en la WebDev Arena, por delante de Claude Fable 5 y GPT-5.6 [4]. Ambos modelos publican pesos abiertos en tamaños que nadie había abierto antes [5] [6]. Y ambos listan precios por token muy por debajo de los buques insignia occidentales [5] [7].
Los resultados de las arenas merecen tomarse en serio. En la tabla fullstack con fecha del 24 de julio de 2026, Kimi K3 max ocupa el puesto 1 con una puntuación de 1.664, por delante de GPT-5.6 Sol con 1.633 y Fable 5 con 1.623 [3]. En la WebDev Arena, cuatro días después, Claude Opus 5 max lidera con 1.712 y Kimi es segundo con 1.682 sobre 3.777 votos, por encima de Fable 5, Sol y GLM-5.2 [4]. La gente, cuando elige libremente, sigue votando por lo que este modelo construye en un navegador.
La apertura también es real. Moonshot presenta Kimi K3 como el primer modelo de pesos abiertos con 2,8 billones de parámetros, con una ventana de contexto de un millón de tokens, visión integrada y un precio de API de 3 $ por millón de tokens de entrada y 15 $ de salida [5]. GLM-5.2 es el hermano pequeño: 753.000 millones de parámetros bajo una licencia MIT sin adornos [6], listado a 1,40 $ de entrada y 4,40 $ de salida [7]. Pon esas etiquetas junto a la lista de precios occidental y la narrativa se escribe sola.
Moonshot es más prudente que sus fans. El post de lanzamiento admite que K3 todavía va por detrás de Fable 5 y GPT-5.6 Sol, y reconoce “una brecha apreciable en la experiencia de uso” frente a ambos [5]. Esa frase, escrita por el propio fabricante, resulta ser también el resumen más exacto de los datos independientes.
¿Qué dicen los números independientes?
Artificial Analysis pasa cada sistema por la misma batería de tres partes: 113 tareas de ingeniería de software (DeepSWE), 84 tareas agénticas de terminal (Terminal-Bench v2) y 124 preguntas técnicas sobre código (SWE-Atlas Q&A), con peso igual en el Coding Agent Index v1.3 [8]. Consultado el 30 de julio de 2026: Kimi K3 saca 61, exactamente igual que GPT-5.6 en esfuerzo medium. Opus 5 medium saca 62. GLM-5.2 saca 43 [1] [2].
Hay un detalle de encuadre que importa más que cualquier puntuación. El índice mide sistemas, no pesos: Kimi corrió dentro de su propia Kimi Code CLI, GLM-5.2 dentro de Claude Code, Sol dentro de Codex, los modelos Claude dentro de Claude Code [1] [2]. Nunca estás midiendo un modelo a secas. Estás midiendo un modelo vestido con un agente concreto a un nivel de esfuerzo concreto.
| Medición | Kimi K3 | GLM-5.2 | Sol medium | Opus 5 medium |
|---|---|---|---|---|
| Coding Agent Index | 61 | 43 | 61 | 62 (El mejor valor de la fila) |
| DeepSWE, % | 64 | 29 | 64 | 63 |
| Terminal-Bench v2, % | 84 (El mejor valor de la fila) | 72 | 78 | 79 |
| SWE-Atlas Q&A, % | 37 | 29 | 40 | 44 (El mejor valor de la fila) |
| Coste por tarea, $ | 3,18 | 6,51 | 2,99 (El mejor valor de la fila) | 3,14 |
| Tiempo activo, min | 23,8 | 25,1 | 5,2 (El mejor valor de la fila) | 12,2 |
La historia de la tabla está en la diagonal: Kimi gana la terminal, Opus gana la comprensión, Sol gana el cronómetro y GLM-5.2 no gana nada con estos ajustes.
Mira primero el empate, porque es el resumen más justo de Kimi en una línea. El mismo 61 que Sol medium, a 3,18 $ por tarea frente a 2,99 $, o sea un 6 % más de dinero [1]. Pero necesita 23,8 minutos activos frente a los 5,2 de Sol, que es el 4,6 veces de la entradilla, y 10,6 millones de tokens frente a 5,8 millones. Contra Opus 5 medium el cuadro se repite: un punto de índice por debajo, cuatro céntimos más por tarea, más o menos el doble de tiempo [2].
El techo sigue siendo occidental. Sol max llega a 67 a 7,08 $ por tarea [1]; Opus 5 xhigh iguala ese 67 a 8,23 $ y firma la mejor comprensión de repositorios de la batería, un 55 % en SWE-Atlas Q&A [2]. Fable 5 max se queda en 66 por 11,71 $ por tarea, la forma más cara de comprar un punto que Opus xhigh también vende [2]. El 84 % de Kimi en Terminal-Bench v2 es territorio de frontera de verdad, por encima del 83 % de Sol high y a pocos puntos de los buques insignia a esfuerzo máximo [1] [2].
El punto débil de Kimi es igual de visible: 37 % en el componente de preguntas sobre código, por debajo del 40 % de Sol medium y muy por debajo de lo que firman las configuraciones de Claude [1] [2]. El perfil se lee como un agente al que se le da mejor hacer que entender lo que ya existe. Para trabajo desde cero apenas importa. Para un repositorio heredado de 300.000 líneas es el trabajo entero.
¿Lo más barato por token es más barato de verdad?
No por sí solo. Una tarea cuesta tokens por precio del token, y un agente que necesita más turnos, más reintentos o más razonamiento multiplica el primer factor más rápido de lo que cualquier descuento encoge el segundo. GLM-5.2 es la prueba medida: el precio de lista más bajo de la tabla y aun así un coste por tarea por encima de todas las configuraciones occidentales en medium [2] [7].
Primero las listas de precios, porque dos me sorprendieron. Hasta el 31 de agosto de 2026, Claude Sonnet 5 se vende a un precio introductorio de 2 $ por millón de tokens de entrada y 10 $ de salida, y pasa a 3 $ y 15 $ desde el 1 de septiembre [9]. Kimi K3 cuesta 3 $ y 15 $ hoy [5]. El famoso modelo chino barato es un 50 % más caro por token que el modelo de volumen de Anthropic este mes, e idéntico en lista desde otoño.
El resto de la tabla: Opus 5 a 5 $ de entrada y 25 $ de salida, Fable 5 a 10 $ y 50 $ [9], GPT-5.6 a 5 $ y 30 $ con un tramo de contexto largo a 10 $ y 45 $ [10], y GLM-5.2 por debajo de todo a 1,40 $ y 4,40 $ con lecturas de caché a 0,26 $ [7].
Dos notas al pie hacen resbaladizas incluso esas etiquetas. Los tokenizadores cambian por fabricante: Anthropic documenta que su tokenizador actual produce en torno a un 30 % más de tokens para el mismo texto que el anterior [9], así que un precio por millón de tokens ni siquiera es una unidad fija entre familias de modelos. Y el razonamiento también cambia: Kimi K3 razona siempre, la FAQ de la plataforma es explícita en que no se puede apagar, y el esfuerzo por defecto es max [11]. Pagas tokens que nunca ves.
- precio de lista, por millón de tokens de entrada
- 1,40 $
- el modelo más barato de esta comparación
- medido, por tarea intentada
- 6,51 $
- dentro de Claude Code, 25,1 minutos activos
- derivado, por tarea resuelta
- 15,14 $
- coste por intento dividido por la tasa de acierto del 43 %
Pasa esa aritmética por toda la tabla y el orden cambia. Sol medium sale a unos 4,90 $ por tarea resuelta, Opus 5 medium a 5,06 $, Kimi K3 a 5,21 $ y GLM-5.2 a 15,14 $, tres veces su competencia occidental. La lectura del gráfico en una línea: bajo medición, la etiqueta más barata de la comparación se convierte en el cambio resuelto más caro.
Y eso todavía ignora la parte cara. Diez minutos de un ingeniero haciendo triaje de una ejecución fallida cuestan más que cualquier número de esa figura. En cuanto los fallos caen sobre un humano en vez de sobre un bucle de reintentos, la tasa de acierto domina por completo al precio del token.
¿En qué es bueno Kimi K3 de verdad?
Trabajo intensivo de terminal, desarrollo web con forma de producto, ejecuciones largas de agentes y cualquier escenario donde poseer los pesos importe. La batería independiente lo respalda, las arenas lo respaldan y el propio posicionamiento de Moonshot encaja [1] [3] [5]. Lo que no es, con la evidencia actual, es un sustituto barato para trabajo pesado sobre repositorios existentes.
El resultado de terminal se sostiene desde dos lados: 84 % medido de forma independiente en la propia CLI de Kimi [1], 88,3 % en la configuración preferida de Moonshot [12]. La promesa de largo recorrido está medida por el fabricante, pero es notable: K3 encabeza la tabla de SWE-Marathon de Moonshot con 42, y esa misma tabla apunta al pie, sin esconderlo, que Fable 5 cayó en modelos de respaldo en el 35 % de esas tareas y que algunas filas de Kimi corrieron una rama precomercial calibrada para hardware H20 [12]. Suma la visión nativa con un codificador dedicado y la ventana de un millón de tokens [12], y la idea de Moonshot de iterar entre código y capturas de pantalla en vivo [5] deja de sonar a marketing.
Las debilidades son igual de concretas. Comprensión: 37 % en preguntas sobre código [1]. Velocidad: 23,8 minutos activos por tarea significan que paralelizas agentes o esperas; tu propia atención no se paraleliza. Y “pesos abiertos” merece cuentas de servilleta antes de que alguien planee autoalojarlo: 2,8 billones de parámetros son alrededor de 1,4 TB de pesos incluso cuantizados a 4 bits, antes de la caché KV y la sobrecarga de servicio. Eso es un clúster, no una estación de trabajo.
El papeleo también cuenta. La licencia es permisiva pero no genérica: un negocio de modelo como servicio que supere 20 millones de dólares de ingresos agregados necesita un acuerdo aparte con Moonshot, y cualquier producto que pase de 100 millones de usuarios activos mensuales o 20 millones de dólares de ingresos mensuales debe mostrar “Kimi K3” de forma destacada; el uso interno está exento [13]. Y los términos estándar de la API permiten a Moonshot usar el contenido del cliente para prestar, mantener, desarrollar, dar soporte y mejorar sus servicios, con las restricciones sobre el uso para entrenar modelos derivadas a acuerdos empresariales aparte [14]. Yo no apuntaría la API pública a un repositorio propietario sin tener esa conversación por escrito.
¿Por qué se estrelló GLM-5.2 en Claude Code?
Nadie fuera de Z.ai lo sabe con exactitud, y esa es justo la cuestión. Los mismos pesos sacan un 81 % en Terminal-Bench dentro del harness Terminus de la propia Z.ai [6] y un 72 % dentro de Claude Code [2]. Lo que se derrumbó en la medición independiente es el sistema alrededor del modelo: llamadas a herramientas, recuperación, comportamiento de caché, encaje con las convenciones del agente. La medición condena una configuración, no necesariamente los pesos.
La fila independiente completa es una lectura dura en cualquier caso: índice 43, DeepSWE 29 %, preguntas sobre código 29 %, 6,51 $ por tarea intentada y, con 25,1 minutos activos, la ejecución más lenta de toda la tabla [2]. Una trayectoria que quema 25 minutos y 6,51 $ con una lista de 1,40 $/4,40 $ es una trayectoria que se pasó la mayor parte del presupuesto dando vueltas en círculo.
Los números propios de Z.ai salen de maquinaria más amiga, y la ficha del modelo lo dice sin rodeos: SWE-Bench Pro en 62,1 vía OpenHands con un prompt de instrucciones a medida, DeepSWE con tiempos límite de dos horas en contenedores aislados, Terminal-Bench vía Terminus con presupuesto de cuatro horas [6]. Nada de eso es trampa. Es un fabricante enseñando el modelo en el entorno para el que lo afinó. Solo que no es evidencia sobre el agente que tú ejecutas de verdad.
Aun así le queda un carril racional. Con 753.000 millones de parámetros bajo MIT [6], GLM-5.2 es el candidato realista al autoalojamiento de los dos, y a 1,40 $ por millón de tokens es un piloto sensato para trabajo masivo con verificación automática: codemods con suites de tests, candidatos de migración, cualquier cosa donde una comprobación determinista atrape el 57 % que falla y los fallos solo cuesten cómputo. En cuanto un humano revisa los fallos, la aritmética se da la vuelta.
Cómo leer una clasificación de código
Los lanzamientos de Kimi y GLM son un caso de estudio de alfabetización en benchmarks, así que este es el mapa que uso antes de creerme un número.
| Señal | Qué premia | Qué no te puede decir |
|---|---|---|
| DeepSWE, 113 tareas | completar tareas de ingeniería de punta a punta | el encaje con las convenciones de tu código |
| Terminal-Bench v2, 84 tareas | llevar una shell a un estado final verificado | la comprensión de un repositorio grande existente |
| SWE-Atlas Q&A, 124 tareas | responder preguntas técnicas sobre código | la capacidad de aterrizar el cambio que describe |
| WebDev y Fullstack Arena | lo que la gente prefiere en votos uno a uno | corrección, tests, seguridad, mantenibilidad |
| Fichas de modelo del fabricante | el modelo en su mejor versión, en su propio entorno | la comparabilidad entre filas |
Después aplica tres descuentos. Primero, el ruido de infraestructura: el equipo de ingeniería de Anthropic midió un vaivén de 6 puntos porcentuales en Terminal-Bench 2.0 solo por los límites de recursos, vio caer las tasas de error de infraestructura del 5,8 % al 0,5 % al aflojar los límites, y concluyó que las diferencias de clasificación por debajo de unos 3 puntos merecen escepticismo hasta que las configuraciones estén documentadas y emparejadas [15]. El empate de Kimi con Sol medium cae dentro de esa banda; trátalo como paridad, no como victoria de ninguno.
Segundo, la asimetría de las notas al pie. La tabla comparativa de Moonshot ejecuta cada competidor en un harness distinto, incluye modelos de respaldo en algunas filas y puntúa su propio benchmark interno, donde Fable 5 registró 13 caídas a respaldo y un rechazo en 80 tareas [12]. Mérito donde toca: Moonshot imprimió esas notas él mismo. Los hilos de lanzamiento que citaban la tabla, no.
Tercero, la disciplina de versiones. El índice independiente lleva versión (v1.3 hoy) porque su mezcla de tareas cambia [8]; una puntuación de una versión no es comparable con la de otra, por mucho que se parezca el nombre. Cualquier comparación que no declare harness, esfuerzo, presupuesto y versión es una corazonada con decimales.
Dónde quedan los modelos en mi enrutado
Todo lo anterior cambia qué probaría primero, no en qué estandarizaría. Mi tabla de enrutado hoy, con los dos recién llegados colocados con honestidad:
| El trabajo | Mi elección hoy |
|---|---|
| Cambios rutinarios con buenos tests | Sonnet 5, a 2 $/10 $ hasta el 31 de agosto de 2026 |
| Bucles rápidos de agente y trabajo de terminal | GPT-5.6 en esfuerzo medium o high |
| Trabajo sobre un repositorio grande existente | Opus 5 en esfuerzo medium o high |
| Fullstack desde cero y builds con mucha UI | Kimi K3, el carril que avalan los votos de arena |
| Trabajo masivo con verificación automática | GLM-5.2 en su harness nativo, como piloto |
| Escalación cuando todo lo demás falla | Fable 5, con cuentagotas |
Es la misma aritmética que me enseñó la semana de lanzamiento de Opus 5: lo que compras de verdad son cambios aprobados, y todo lo demás, tokens incluidos, es un insumo.
Dos resultados moverían estas filas. Una ejecución de Kimi K3 en un harness neutral (Claude Code o Codex) que sostenga ese 61, lo que probaría que la puntuación pertenece al modelo y no a su CLI de casa. Y una medición independiente de GLM-5.2 en su agente nativo, hecha por alguien que no lo venda. Hasta entonces, el resumen honesto se mantiene: los modelos son reales, los precios son marketing y los recibos están arriba.
Fuentes
- Codex vs Kimi Code CLI: coding agent comparison
- Claude Code vs OpenCode: coding agent comparison
- Fullstack Arena leaderboard
- WebDev Arena leaderboard
- Kimi K3
- GLM-5.2 model card
- GLM-5.2 API pricing
- Coding Agent Index
- Pricing
- API pricing
- Kimi K3 quickstart
- Kimi K3 model card
- Kimi K3 license
- Model use agreement
- Benchmark scores and infrastructure noise