Opus 5.5 programma meglio. Il costo per compito varia
Opus 5.5 migliora nei test indipendenti e riduce i prezzi dei token. Confronto costi per compito, livelli di ragionamento e prime esperienze su Reddit.

Claude Opus 5.5 è arrivato il 22 settembre 2026 con token meno cari e un netto miglioramento nei test indipendenti di programmazione. Vale la pena provarlo, ma il costo per compito completato richiede attenzione: i risparmi di Anthropic e le misure di Artificial Analysis al livello massimo riguardano lavori e impostazioni diversi. Io partirei dal livello medio. [1] [2] [3]
Quanto migliora Opus 5.5 nella programmazione?
Il test indipendente mostra un progresso significativo rispetto a Opus 5: Artificial Analysis registra un aumento di 10,6 punti percentuali su Terminal-Bench 4.0. Il test assegna a un agente compiti pratici nel terminale, quindi si avvicina al lavoro in un repository più di una breve domanda di programmazione. [2]
Mostra i dati in tabella
| Benchmark | Opus 5.5 | Opus 5 |
|---|---|---|
| Terminal-Bench 4.0 | 59,6% | 49,0% |
Artificial Analysis esegue tutti i 66 compiti con mini-swe-agent e calcola la media dei successi al primo tentativo su tre ripetizioni. Usare lo stesso software per l’agente rende utile il confronto. Il risultato misura comunque quella specifica configurazione, non ogni possibile utilizzo di Claude Code. [2]
I risultati di CursorBench pubblicati da Anthropic indicano la stessa direzione: 57,8% al livello massimo, contro il 46,6% di Opus 5. Anche il 52,5% di Opus 5.5 al livello medio supera il precedente massimo. Secondo la scheda di sistema di Anthropic, Cursor ha eseguito la valutazione con il proprio software per agenti. È un’ulteriore evidenza, ma usa una configurazione diversa dal test di Artificial Analysis. [10]
Il risultato al livello medio mi interessa più di un’altra vittoria al massimo. Nella mia analisi di Opus 5 come sviluppatore esecutore, il problema era quanta supervisione potesse ancora richiedere un buon codice. Ottenere un risultato migliore con meno ragionamento sarebbe utile; ottenerlo dopo un’esecuzione molto più lunga è un compromesso diverso.
Opus 5.5 costa davvero meno per compito?
Opus 5.5 costa meno per token in ingresso e in uscita, ma la fattura dipende da quanto lavoro svolge. Claude Platform Docs indica 4 dollari per milione di token in ingresso e 20 per milione in uscita, contro i 5 e 25 dollari di Opus 5. Anthropic dichiara un costo tipico per compito inferiore di circa il 40%, perché il nuovo modello usa anche meno token nelle sue valutazioni. [5] [1]
Artificial Analysis offre un confronto utile. Il suo Intelligence Index attuale sale da 51 a 58, mentre il costo misurato per compito dell’indice aumenta leggermente da 5,86 a 5,98 dollari al livello massimo. Sono compiti della sua suite di valutazione, non una previsione della tua spesa media per programmare. [3] [4]
Artificial Analysis, ragionamento massimo, consultazione del 22 settembre 2026. I punti dell’indice non sono percentuali. [3][4]
| Misurazione indipendente | Opus 5 | Opus 5.5 |
|---|---|---|
| AA Intelligence Index v4.3.2 | 51 | 58 (Valore migliore della riga) |
| Costo per compito dell’indice, USD | 5,86 | 5,98 |
In questa configurazione si ottengono quindi capacità misurate migliori a un costo quasi identico. Questo non contraddice i risparmi di Anthropic su altri lavori, ma non inserirei un risparmio universale del 40% in un budget. Conta anche la versione dell’indice: entrambi i punteggi appartengono alla v4.3.2. Un vecchio risultato di Opus 5 calcolato con una versione precedente non è direttamente confrontabile con 58.
La guida di prompting di Anthropic spiega perché conviene controllare il livello di ragionamento. A parità di nome dell’impostazione, Opus 5.5 può ragionare di più per turno rispetto a Opus 5, soprattutto con xhigh e max. La guida consiglia di provare nuovamente i livelli anziché mantenere la vecchia scelta. Aggiunge che il livello medio può eguagliare o superare Opus 5 al livello alto nella programmazione e nel lavoro intellettuale. [6]
In pratica, pagherei per il ragionamento necessario al compito. Impostare sempre il massimo impedirebbe di capire se il nuovo modello può terminare lo stesso lavoro con meno passaggi.
Cosa dice Reddit dell’uso di Opus 5.5?
Le testimonianze più utili del giorno di lancio riguardano risposte più brevi e un’interazione più semplice, con opinioni discordanti sugli errori di programmazione. Sono contributi spontanei del 22 settembre, non un tasso di errore misurato. Non ho eseguito un confronto pratico controllato per questo articolo.
Su r/ClaudeCode, un utente ha pubblicato le risposte di varie generazioni di Opus allo stesso prompt e ha trovato quelle di 5.5 più leggibili di quelle di 5. È un esempio limitato, ma offre qualcosa di concreto da esaminare invece della semplice impressione che il modello sia più intelligente. [7]
Un altro thread su r/ClaudeAI elogia la velocità e la capacità di individuare problemi nell’interfaccia. Nei commenti compare però anche un caso di modifiche ripetute senza uscita. Un terzo thread raccoglie sia testimonianze di risposte più veloci sia una lamentela su implementazioni incomplete e istruzioni di progetto ignorate. [8] [9]
Lo considero un motivo per verificare comunicazione e rispetto delle istruzioni separatamente dalla qualità del codice. Un modello può produrre una patch migliore e rendere comunque faticosa la sessione. È anche il motivo per cui la mia valutazione del workflow di Opus 5 dedica tanto spazio ai limiti del compito e alle istruzioni esistenti.
Cosa devono controllare gli sviluppatori prima di passare?
La migrazione dell’API richiede qualcosa in più della sostituzione del nome del modello. Opus 5.5 usa claude-opus-5-5, parte dal livello medio e mantiene sempre attivo il ragionamento adattivo. La documentazione descrive anche cambiamenti nell’uso degli strumenti, inclusi errori quando se ne forza la chiamata. Le integrazioni di agenti esistenti dovrebbero leggere queste note prima del passaggio. [5]
Per il normale uso di Claude Code partirei da un bug esistente e da un test di accettazione noto, poi registrerei se il livello medio produce una patch accettabile. Conterei anche le correzioni: ripetere la stessa istruzione ha un costo, anche quando quel tempo non compare nella fattura API.
Nello stesso giorno è cambiata anche l’alternativa. I tagli di prezzo e i benchmark di GPT-6 Sol e Luna offrono un motivo diverso per usarli nel lavoro quotidiano, con aumenti minori nell’indice di intelligenza e token molto meno cari. Li confronterei su un compito che conosco abbastanza da poterne controllare il risultato, poi sceglierei il modello che porta a un lavoro accettabile con meno interventi.
Fonti
- Introducing Claude Opus 5.5
- Terminal-Bench 4.0
- Claude Opus 5.5 model analysis
- Claude Opus 5 model analysis
- Claude Opus 5.5 overview
- Prompting Claude Opus 5.5
- Proof that Opus 5.5 is easier to talk to/deal with
- Opus 5.5 in Claude Code is crazy fast especially
- Opus 5.5 in the release notes
- Claude Opus 5.5 System Card





