
GPT-6 Sol e Luna: il vantaggio è soprattutto nel prezzo
GPT-6 Sol e Luna riducono i prezzi API, con progressi più piccoli nei test. Confronto risultati, accesso in ChatGPT e le prime esperienze degli utenti Reddit.
Tutti gli articoli con il tag benchmarks, dal più recente.

GPT-6 Sol e Luna riducono i prezzi API, con progressi più piccoli nei test. Confronto risultati, accesso in ChatGPT e le prime esperienze degli utenti Reddit.

Opus 5.5 migliora nei test indipendenti e riduce i prezzi dei token. Confronto costi per compito, livelli di ragionamento e prime esperienze su Reddit.

GPT-6 Astra consuma crediti a 2,5 volte la tariffa di Sol e in chat sembra più umano. Ho verificato i limiti di utilizzo, i benchmark e le prime reazioni.

Muse Spark 1.3 ha segnato 62 su Artificial Analysis, sopra GPT-6 Astra, poi è finito nono. Ho ricostruito da dove veniva il punteggio e quanto costa.

Fable 5.1 supera Fable 5 nei compiti lunghi svolti da agenti, ma Opus 5 resta vicino e ha tariffe base dimezzate. Ho verificato benchmark e primi report.

V4 Flash costa 0,14 $ in ingresso e 0,28 $ in uscita per milione di token. Ho verificato se lo sconto dal 97 al 99% compensa le sconfitte nei benchmark.

DeepSWE mette Luna Max 2,2 punti dietro Sol High a circa un sesto del costo per tentativo. Spiego perché nei repository i due modelli restano molto diversi.

Ho confrontato Sol, Terra, Opus 5 e Fable 5 nei benchmark di coding. Il vincitore cambia a seconda del task, dell'effort, dell'agente e del budget.

Kimi K3 pareggia GPT-5.6 medium, ma richiede 4,6 volte il tempo. GLM-5.2 costa poco per token e molto per task. Verifico dove entrambi hanno ancora senso.

Opus 5 eguaglia Fable 5 nei benchmark e costa la metà per token, ma supervisionarlo è frustrante. Ecco perché Fable merita ancora il ruolo di capo.