GPT-5.6 Sol lo encuentra todo. Ese es el problema
GPT-5.6 Sol devolvió 400 hallazgos donde Fable 5 halló 70, y luego cayó en la sobreingeniería al corregirlos. El mismo rasgo explica los dos resultados.
GPT-5.6 Sol prefiere perseguir un riesgo de más antes que uno de menos. Ese único rasgo produjo a la vez la auditoría más completa que he recibido de mi código y las correcciones con más sobreingeniería que he tenido que revertir. El modelo está bien. Lo que falla es la autoridad que le damos, y eso tiene arreglo.
OpenAI lanzó la familia GPT-5.6 el 9 de julio de 2026, con Sol en lo más alto y Ultra como su modo multiagente [1]. Llevo los veinte días siguientes usando Sol junto a Fable 5 y Opus 5 de Claude en los mismos repositorios, y no dejo de dar vueltas a una sensación incómoda: admiro este modelo, y no me fío del todo de él mientras trabaja. Este artículo es mi manera de comprobar si el problema es mío o es un patrón. Es un patrón.
¿Sol cae de verdad en la sobreingeniería, o solo me pasa a mí?
No solo te pasa a ti. En r/codex aparece una y otra vez la misma medición: código correcto, demasiado código. El hilo más claro compara Sol 5.6 High con Fable 5 High en tareas idénticas y describe implementaciones de Sol que a veces eran tres veces más grandes [2].
El ejemplo concreto de ese hilo es un backfill de DynamoDB. Fable lo resolvió en unas 100 líneas. Sol produjo unas 400, añadiendo protecciones contra condiciones de carrera, verificación de lectura tras escritura y alternancia entre lecturas consistentes y no consistentes. El veredicto del autor no fue que el código estuviera mal. Fue que tanta exhaustividad hacía el cambio más difícil de entender y validar [2].
El patrón sobrevive a cambios de nivel y de modo. Un usuario describe a Sol en xhigh persiguiendo “casos límite de casos límite” pese a un plan definido y a barreras explícitas contra la deriva de alcance [3]. En el hilo titulado “72 hours of Sol Ultra”, el modelo no había superado su primer gran hito tras tres días, porque bugs cada vez más pequeños y tareas de endurecimiento se colaban delante del objetivo [4]. En ese mismo hilo hay un usuario cuya auditoría con corrección automática reescribió secciones enteras de su web, de las que la mitad hubo que revertir, y otro cuyo arreglo funcional de index + 1 acabó refactorizado en un cambio de más de 1.000 líneas [4]. Varios usuarios prefieren High a Ultra sin rodeos: más centrado, menos ruido de coordinación, mejor sujetando el objetivo principal [5]. Otros describen bucles de implementación y revisión que reabren problemas ya resueltos durante horas, uno de ellos durante ocho [6].
Mientras tanto, en Hacker News el reparto de papeles ya es folclore: Codex como revisor pedante, Claude para los problemas difíciles y el diseño de alto nivel [7].
OpenAI escribió su propia lista de quejas
La corroboración más fuerte es oficial. La system card de GPT-5.6 de OpenAI reconoce una tendencia mayor que la de GPT-5.5 a ir más allá de la intención del usuario, incluyendo ejecutar o intentar acciones que nadie pidió, y recomienda supervisión en sesiones largas de agentes de código. Las tasas absolutas, matiza, siguen siendo bajas [8]. Insistencia entrenada, documentada por el propio fabricante.
La guía de prompting convierte el mismo rasgo en consejo: GPT-5.6 es proactivo y persistente, así que define límites explícitos de autonomía y aprobación, y separa con claridad explicar, revisar y planificar de implementar [9]. La guía de modelos de Codex es igual de directa con la escalera de modos: Ultra es razonamiento máximo más delegación automática de tareas, descrito en el lanzamiento como cuatro agentes en paralelo por defecto [1], recomendado cuando el trabajo se divide de verdad en partes paralelas, y la mayoría de las tareas no necesita ni Max ni Ultra [10].
Junta esos tres documentos y la forma del problema se ve sola. Un modelo entrenado para no dejar piedra sin levantar, con más presupuesto de razonamiento, agentes extra y un objetivo abierto tipo “déjalo listo para producción”, no tiene ningún punto natural de parada. Nada de eso es un bug. Todo eso es política del producto.
¿Qué ha pasado con la ventana de contexto de Sol?
El modelo por API admite 1,05 millones de tokens y emite hasta 128K [11]. El producto de suscripción no: el centro de ayuda de OpenAI documenta 272K para Sol en ChatGPT Business [12], y el perfil que el servidor entrega al cliente de Codex bajó de 372.000 tokens brutos (353.400 efectivos) a 272.000 (258.400 efectivos) el 13 de julio, un recorte del 26,9 % [13].
Un responsable de OpenAI explicó en público que el perfil de 372K consumía el uso de las suscripciones más rápido de lo previsto y que la ventana grande volvería [14]. A 29 de julio de 2026, la documentación sigue diciendo 272K [12]. Como contraste, Fable 5 y Opus 5 funcionan con una ventana de 1M de tokens en Claude Code en los planes de pago [15].
Ver los datos en una tabla
| Superficie | Valor |
|---|---|
| Sol vía API | 1050K |
| Codex en el lanzamiento, 9 de julio | 372K |
| Codex desde el 13 de julio | 272K |
| Claude Code, Fable 5 y Opus 5 | 1000K |
La barra que hay que mirar es la distancia entre lo que el modelo puede sostener y lo que el producto te da: Claude Code funciona hoy con casi cuatro veces la ventana de suscripción de Sol, en modelos que compiten directamente [15].
El número importa por la compactación. Codex compacta las conversaciones largas automáticamente, y /compact resume el chat visible para liberar tokens; la misma página de buenas prácticas advierte contra llevar un proyecto entero en una sola conversación [16]. Un resumen tiene que elegir qué conserva, y las primeras víctimas son justo las líneas sin glamur que mantienen al modelo a raya: las restricciones negativas (“no caigas en la sobreingeniería”), los riesgos aceptados, la lista de cosas que decidimos no construir. Los docs de subagentes de OpenAI hasta tienen nombres para el fallo: context pollution y context rot [17]. Esa es mi experiencia con Sol en una línea: nunca olvida cómo se programa. Olvida lo que acordamos que no haría.
¿Por qué Ultra se siente como perder el control?
Porque Ultra no es un contrato de jefe y operarios. Los docs describen cómo el harness lanza, enruta y recoge hilos de agentes, pero en ningún sitio prometen que el agente principal solo delegue; puede seguir leyendo, razonando e implementando en paralelo a sus propios trabajadores [17]. El modo añade capacidad. No añade contención.
Los modos de fallo que eso produce están documentados. Una issue abierta de Codex describe al padre asumiendo que un subagente lento pero sano se ha atascado, y rehaciendo el trabajo en silencio, con gasto duplicado de tokens y un contexto padre inflado como resultado [18]. Un informe detallado del 24 de julio midió los turnos puros de espera y estado en el 19,8 % del volumen bruto de tokens de un usuario, con el modelo reentrando cada 30 a 60 segundos para sondear agentes que iban perfectamente [19]. Es telemetría de usuario, no datos de facturación, pero encaja con lo que el panel de progreso transmite desde fuera: un jefe incapaz de dejar de comprobar.
Mi peor caso fue estructural. Un brief de arquitectura de sistema que Fable 5 convirtió en un plano coherente en más o menos una hora le llevó a Sol Ultra unas cuatro, la mayor parte dedicada a trocear un diseño fuertemente acoplado entre agentes paralelos y a reconciliar después sus suposiciones contradictorias. El equipo de ingeniería de Anthropic llegó a la misma conclusión sobre su propia pila multiagente: los agentes paralelos rinden en trabajo en anchura con hilos independientes, programar suele tener menos de esos hilos que investigar, y sus sesiones multiagente quemaron unas 15 veces los tokens de un chat normal [20]. Una arquitectura es un solo argumento. Dieciséis fragmentos bien razonados de un argumento no son su versión barata.
Y luego están los fallos que no son lentos, sino que llegan mal en el tiempo. Dos veces pedí a Sol un estado de la tarea, recibí una respuesta correcta, y media hora después lo vi responder otra vez al mismo mensaje. El tracker de Codex tiene informes casi idénticos: una sesión larga que devuelve una respuesta idéntica a otra de muchos turnos atrás [21], y un bug sobre responder a un mensaje anterior en lugar del último, cerrado como duplicado de una issue existente [22]. Cuando eso pasa, dejo de tratar el hilo como a un colega y empiezo a tratarlo como a un fichero corrupto: verifico el estado real con git y la suite de tests, y sigo en una sesión nueva.
La auditoría que me lo dejó claro
Antes de una release, apunté a los dos laboratorios al mismo sistema grande de producción con el mismo brief de solo lectura: seguridad, lógica, consistencia entre servicios. Sol Ultra devolvió unos 400 hallazgos, cargados de severidad alta. Fable 5 devolvió unos 70, encabezados por los críticos y visiblemente despreocupado por la cola de severidad media.
- hallazgos de Sol Ultra
- 400
- mucha severidad alta, larga cola media
- hallazgos de Fable 5
- 70
- mismo brief, primero lo crítico
Los recuentos no son la historia; la composición sí. Puse a Fable a triar los 400 de Sol como afirmaciones sin demostrar, y pasaron dos cosas. Descartó una larga cola de duplicados, casos límite teóricos y sugerencias de endurecimiento disfrazadas de bugs. Y confirmó un puñado de problemas reales que él mismo había pasado por alto. La cobertura complementaria es real. El ruido en el que llega, también.
Los primeros números de benchmark de Artificial Analysis dibujan la misma silueta: Sol Max lidera su Coding Agent Index con 80 y Fable 5 queda por detrás, mientras Fable mantiene un punto de ventaja en el índice general de inteligencia, 60 contra 59, y una ventaja clara en su evaluación de calidad analítica [23]. Cobertura y criterio son habilidades distintas. Ahora mismo, los laboratorios de frontera las venden por separado.
Mi error en la semana de lanzamiento fue el obvio: le dije a Sol que corrigiera sus propios hallazgos. Lo que volvió era defendible línea a línea e imposible de publicar en conjunto, y pasé un fin de semana deshaciéndolo. OpenAI ha escrito desde entonces el flujo correcto en sus propios docs de seguridad: acepta un hallazgo y genera un parche acotado, y explícitamente no pidas al agente que corrija todos los hallazgos de un escaneo en un solo chat [24]; prefiere el cambio seguro más pequeño con evidencia de regresión enfocada, un hallazgo por tarea [25]; y trata cada hallazgo importado como una afirmación sin demostrar hasta que un triaje de solo lectura devuelva un veredicto [26]. Que un fabricante documente “no le des al modelo su propia lista de tareas” es la honestidad de producto más útil que he leído este año.
Encuéntralo todo. No toques nada.
El marco al que he llegado: Sol es un instrumento de máxima cobertura. Apuntado al descubrimiento, ese rasgo es un regalo. Con autoridad sobre alcance, presupuesto y condiciones de parada, el mismo rasgo se convierte en sesiones de planificación de cuatro horas y backlogs de 400 elementos.
plano
- Fable 5 un contexto, una arquitectura
auditoría
- Sol Ultra solo lectura, máxima cobertura
triaje
- Fable 5 un veredicto por hallazgo
corrección
- Agente acotado un hallazgo, presupuesto de cambio
Fable es dueño de la forma y de los veredictos. Sol es dueño de la cobertura. Quien implementa recibe un presupuesto, no una misión. Los detalles aburridos son los que lo sostienen:
- Las auditorías son de solo lectura, con condición de parada cerrada. “Continúa hasta que no queden problemas” es una invitación que Sol siempre acepta. “Una pasada, un veredicto por hallazgo, y luego para” es una tarea que termina.
- Las correcciones llevan presupuesto de cambio. Un hallazgo, ficheros nombrados, un tope de líneas, nada de limpieza adyacente:
Fix only finding SEC-014.
Allowed files: src/billing/ and its tests.
Budget: at most 3 files and 120 net lines. No new dependencies.
No adjacent cleanup, no refactors, no extra hardening.
Revalidate the finding first. Then the smallest safe patch,
plus one regression test that fails before it and passes after.
Stop when that test and the existing suite are green.
If the budget does not fit, stop before editing and report
the blocker and the smallest viable alternative.
- La memoria vive en ficheros, no en el chat. Las reglas duraderas van en un AGENTS.md pequeño [27]. El entregable actual y su condición de parada van en un goal, el mecanismo que OpenAI diseñó para objetivos que deben sobrevivir a la compactación [28]. Las decisiones y el estado van en markdown versionado, que la propia guía de OpenAI para tareas largas trata como la defensa principal contra la deriva [29]. La conversación es un canal de comunicación. El repositorio es la memoria.
Nada de esto es un alegato contra Sol. Es el revisor de gran angular más fuerte que he usado; encontró problemas reales que Fable pasó por alto, y el mismo hilo de las 72 horas que documenta sus peores bucles también le atribuye haber reducido casi a la mitad el tiempo de ejecución de un pipeline paralelo complejo [4]. Opus 5, defendí en la pieza anterior, es un gran empleado que necesita un jefe. Sol es un investigador brillante que necesita una orden de registro: busca en todas partes, no toques nada, y cada afirmación pasa ante un juez. La inteligencia, en las dos casas, es real. Lo que estás diseñando ahora es el organigrama.
Fuentes
- Introducing GPT-5.6
- Sol 5.6 High overengineers compared to Fable 5
- Sol xhigh is a monster of overengineering
- 72 hours of Sol Ultra
- 5.6 Sol High, 5.6 Sol Ultra
- GPT-5.6 Sol gets stuck in implementation and review loops
- GPT-5.6 launch discussion
- GPT-5.6 system card
- GPT-5.6 prompting guide
- Codex models and reasoning levels
- Models reference
- ChatGPT Business models and limits
- GPT-5.6 Sol Codex context window reduced from 372K to 272K
- On the Codex context window change
- How large is Claude's context window?
- ChatGPT best practices
- Codex subagents
- Parent agent duplicates work of an active subagent
- Codex repeatedly re-enters the model during wait and status polling
- How we built our multi-agent research system
- Codex returns an identical answer from earlier turns
- Stale final answer returned for a previous message
- GPT-5.6 benchmarks across Intelligence, Speed and Cost
- Codex Security: scans
- Codex Security: fix findings
- Codex Security: triage a backlog
- AGENTS.md configuration
- Follow goals with Codex
- Run long-horizon tasks with Codex