Opus 5.5: besserer Code, offene Fragen zu den Kosten
Opus 5.5 legt in unabhängigen Coding-Tests zu und senkt Tokenpreise. Ich vergleiche Aufgabenkosten, Denkaufwand und erste Reddit-Berichte aus dem Alltag.

Claude Opus 5.5 erschien am 22. September 2026 mit niedrigeren Tokenpreisen und deutlich besseren Ergebnissen in unabhängigen Coding-Tests. Ein Versuch lohnt sich, doch die Kosten pro erledigter Aufgabe brauchen einen genaueren Blick: Anthropics Einsparungen und die Messungen von Artificial Analysis bei maximalem Denkaufwand stammen aus unterschiedlichen Aufgaben und Einstellungen. Ich würde mit mittlerem Denkaufwand beginnen. [1] [2] [3]
Wie viel besser programmiert Opus 5.5?
Der unabhängige Coding-Test zeigt einen deutlichen Fortschritt gegenüber Opus 5: Artificial Analysis meldet auf Terminal-Bench 4.0 einen Zuwachs von 10,6 Prozentpunkten. Der Test stellt einem Agenten praktische Terminalaufgaben und liegt damit näher an der Arbeit in einem Repository als eine kurze Programmierfrage. [2]
Daten als Tabelle anzeigen
| Benchmark | Opus 5.5 | Opus 5 |
|---|---|---|
| Terminal-Bench 4.0 | 59,6 % | 49,0 % |
Artificial Analysis führt alle 66 Aufgaben mit mini-swe-agent aus und mittelt die Erfolgsquote einzelner Versuche über drei Wiederholungen. Dieselbe Agentensoftware macht den Vergleich aussagekräftig. Gemessen wird allerdings diese konkrete Konfiguration, nicht jede mögliche Nutzung von Claude Code. [2]
Die von Anthropic veröffentlichten CursorBench-Ergebnisse zeigen in dieselbe Richtung: 57,8 % bei maximalem Denkaufwand gegenüber 46,6 % für Opus 5. Selbst Opus 5.5 mit mittlerem Denkaufwand erreicht 52,5 % und übertrifft damit den älteren Maximalwert. Laut Anthropics System Card hat Cursor den Test mit seiner eigenen Agentensoftware durchgeführt. Das liefert zusätzliche Hinweise, ist aber ein anderer Aufbau als der Test von Artificial Analysis. [10]
Das mittlere Ergebnis interessiert mich mehr als ein weiterer Sieg bei maximalem Aufwand. In meiner Einschätzung von Opus 5 als ausführendem Entwickler ging es darum, wie viel Aufsicht selbst guter Code noch erfordern kann. Bessere Ergebnisse mit weniger Denken wären nützlich; bessere Ergebnisse nach einem viel längeren Durchlauf sind eine andere Abwägung.
Ist Opus 5.5 pro Aufgabe tatsächlich günstiger?
Opus 5.5 kostet pro Eingabe- und Ausgabetoken weniger, doch die Rechnung hängt davon ab, wie viel Arbeit das Modell daraus macht. Claude Platform Docs nennt 4 US-Dollar pro Million Eingabetokens und 20 US-Dollar pro Million Ausgabetokens, statt 5 und 25 US-Dollar für Opus 5. Anthropic berichtet von ungefähr 40 % niedrigeren typischen Aufgabenkosten, weil das neue Modell in seinen Tests auch weniger Tokens verbraucht. [5] [1]
Artificial Analysis liefert einen hilfreichen Gegenpunkt. Der aktuelle Intelligence Index steigt von 51 auf 58, während die gemessenen Kosten pro Indexaufgabe bei maximalem Denkaufwand leicht von 5,86 auf 5,98 US-Dollar steigen. Das sind Aufgaben der Testsuite, keine Prognose für deine durchschnittliche Programmierrechnung. [3] [4]
Artificial Analysis, maximaler Denkaufwand, abgerufen am 22. September 2026. Indexpunkte sind keine Prozentwerte. [3][4]
| Unabhängige Messung | Opus 5 | Opus 5.5 |
|---|---|---|
| AA Intelligence Index v4.3.2 | 51 | 58 (Bester Wert der Zeile) |
| Kosten pro Indexaufgabe, USD | 5,86 | 5,98 |
In diesem Aufbau bekommt man also für ungefähr denselben Betrag mehr gemessene Leistungsfähigkeit. Das widerspricht Anthropics Einsparungen bei anderen Aufgaben nicht. Eine pauschale Ersparnis von 40 % würde ich trotzdem nicht ins Budget schreiben. Auch die Indexversion zählt: Beide Werte stammen aus v4.3.2. Ein älterer Opus-5-Wert aus einer früheren Version lässt sich nicht direkt mit 58 vergleichen.
Anthropics Prompting-Leitfaden erklärt, weshalb sich ein Blick auf den Denkaufwand lohnt. Bei gleich benannter Einstellung kann Opus 5.5 pro Antwort mehr denken als Opus 5, besonders bei xhigh und max. Der Leitfaden empfiehlt, die Stufen erneut zu testen, statt die bisherige Auswahl zu übernehmen. Mittlerer Aufwand könne beim Programmieren und bei Wissensarbeit außerdem Opus 5 auf hoher Stufe erreichen oder übertreffen. [6]
Für mich heißt das: nur so viel Denkaufwand einsetzen, wie die Aufgabe braucht. Wer grundsätzlich die höchste Stufe wählt, erkennt nicht, ob das neue Modell denselben Auftrag auch mit weniger Arbeit erledigen kann.
Was sagt Reddit zur Arbeit mit Opus 5.5?
Die nützlichsten Reddit-Berichte vom Veröffentlichungstag betreffen kürzere Antworten und eine angenehmere Zusammenarbeit. Ob Programmierfehler seltener geworden sind, bleibt umstritten. Diese Beiträge vom 22. September sind eine selbst ausgewählte Stichprobe, keine gemessene Fehlerquote. Für diesen Artikel habe ich keinen kontrollierten Praxistest durchgeführt.
In r/ClaudeCode veröffentlichte ein Nutzer Antworten mehrerer Opus-Generationen auf denselben Prompt und fand 5.5 leichter lesbar als 5. Das ist ein eng begrenztes Beispiel, liefert aber etwas Konkretes zum Prüfen statt der bloßen Behauptung, das Modell wirke intelligenter. [7]
Ein anderer Beitrag in r/ClaudeAI lobt die Geschwindigkeit und das Erkennen von UI-Problemen. In den Kommentaren berichtet jemand allerdings von einer Schleife wiederholter Änderungen. Ein weiterer Release-Thread enthält sowohl Berichte über schnellere Antworten als auch eine Beschwerde über unvollständige Implementierungen und ignorierte Projektanweisungen. [8] [9]
Deshalb würde ich Kommunikation und das Befolgen von Anweisungen getrennt von der Codequalität prüfen. Ein Modell kann einen besseren Patch schreiben und die Sitzung trotzdem anstrengend machen. Genau deshalb beschäftigt sich meine Bewertung des Opus-5-Workflows ausführlich mit Aufgabenumfang und vorhandenen Anweisungen.
Was sollten Entwickler vor dem Wechsel prüfen?
Bei einer API-Migration reicht es nicht ganz, nur den Modellnamen auszutauschen. Opus 5.5 verwendet claude-opus-5-5, startet mit mittlerem Denkaufwand und aktiviert adaptives Denken immer. Die Übersicht beschreibt außerdem Änderungen bei Werkzeugaufrufen, darunter Fehler bei erzwungener Werkzeugnutzung. Bestehende Agentenintegrationen sollten diese Migrationshinweise vor dem Wechsel prüfen. [5]
Für die normale Arbeit mit Claude Code würde ich mit einem vorhandenen Fehler und einem bekannten Abnahmetest beginnen. Dann würde ich festhalten, ob mittlerer Denkaufwand einen akzeptablen Patch liefert. Auch Korrekturen zählen: Dieselbe Anweisung wiederholen zu müssen kostet Zeit, selbst wenn sie auf keiner API-Rechnung erscheint.
Am selben Tag hat sich auch die Alternative verändert. Die Preissenkungen und Benchmarks von GPT-6 Sol und Luna liefern andere Argumente für den Alltag: kleinere Zugewinne im Intelligenzindex und deutlich niedrigere Tokenpreise. Ich würde die Modelle mit einer Aufgabe vergleichen, die ich gut genug für eine Prüfung verstehe, und das wählen, dessen Ergebnis mit den wenigsten Eingriffen abnahmefähig wird.
Quellen
- Introducing Claude Opus 5.5
- Terminal-Bench 4.0
- Claude Opus 5.5 model analysis
- Claude Opus 5 model analysis
- Claude Opus 5.5 overview
- Prompting Claude Opus 5.5
- Proof that Opus 5.5 is easier to talk to/deal with
- Opus 5.5 in Claude Code is crazy fast especially
- Opus 5.5 in the release notes
- Claude Opus 5.5 System Card





