
GPT-6 Sol e Luna: a melhoria está sobretudo no preço
GPT-6 Sol e Luna baixam os preços da API, com ganhos menores nos testes. Comparo resultados, acesso no ChatGPT e as primeiras experiências no Reddit.
Todos os artigos com a tag benchmarks, do mais recente para o mais antigo.

GPT-6 Sol e Luna baixam os preços da API, com ganhos menores nos testes. Comparo resultados, acesso no ChatGPT e as primeiras experiências no Reddit.

Opus 5.5 melhora nos testes independentes e reduz os preços dos tokens. Comparo custos por tarefa, níveis de raciocínio e os primeiros relatos no Reddit.

O GPT-6 Astra da OpenAI consome créditos a 2,5 vezes a tarifa do Sol e conversa de forma mais humana. Analisei os limites, os benchmarks e os relatos iniciais.

O Muse Spark 1.3 marcou 62 na Artificial Analysis, à frente do GPT-6 Astra, e caiu para nono numa reavaliação. Segui o rasto da pontuação e do preço.

Fable 5.1 supera o antecessor em tarefas longas de agentes, mas o Opus 5 mantém-se próximo e custa metade do preço base. Analisei benchmarks e relatos iniciais.

O V4 Flash custa 0,14 dólares à entrada e 0,28 à saída por milhão de tokens. Verifiquei se o desconto de 97 a 99% compensa perder os benchmarks.

O DeepSWE põe Luna Max 2,2 pontos atrás de Sol High por cerca de um sexto do custo. Explico porque podem funcionar de forma tão diferente num repositório.

Comparei Sol, Terra, Opus 5 e Fable 5 em benchmarks de programação. O vencedor muda conforme a tarefa, o esforço, a configuração do agente e o orçamento.

O Kimi K3 empata com o GPT-5.6 medium, mas demora 4,6 vezes mais. O GLM-5.2 é barato por token e caro por tarefa. Verifiquei onde ambos vencem.

O Opus 5 iguala o Fable 5 nos benchmarks por metade do preço por token, mas é difícil de supervisionar. Explico quando cada modelo compensa.