GPT-6 Sol und Luna: Das Upgrade steckt im Preis

GPT-6 Sol und Luna senken die API-Preise, die Benchmark-Gewinne fallen kleiner aus. Ich vergleiche Ergebnisse, ChatGPT-Zugang und erste Stimmen auf Reddit.

Releases
Auf dieser Seite
  1. Was ändert sich an den API-Preisen?
  2. Zeigen die GPT-6-Benchmarks einen großen Fortschritt?
  3. Kannst du Sol und Luna in ChatGPT nutzen?
  4. Was fällt Reddit-Nutzern auf?

GPT-6 Sol und Luna erschienen am 22. September 2026 mit ihrem stärksten unmittelbaren Argument in der Preisliste: Die regulären API-Preise für Sols Eingabe und Ausgabe liegen bei der Hälfte von GPT-5.6 Sol. Unabhängige Benchmarks zeigen bessere Coding-Ergebnisse für Sol, aber nur kleine oder praktisch unveränderte Intelligenzindex-Werte. Für mich ist das zuerst ein Upgrade beim Preis-Leistungs-Verhältnis. [1] [2] [3]

Was ändert sich an den API-Preisen?

Die Preissenkungen sind groß genug, um auch ohne große Qualitätsgewinne bei deinen Aufgaben etwas zu verändern. OpenAI halbiert Sols Eingabe- und Ausgabepreise. Bei Luna halbiert sich der Eingabepreis, während der Ausgabepreis von 1,20 auf 0,50 US-Dollar pro Million Tokens fällt. [2]

OpenAI-Standardpreise für API-Anfragen mit kurzem Kontext, abgerufen am 22. September 2026. Ungecachte Eingabe, keine Abotarife. [2]

Modell Eingabe, USD / 1 Mio. Tokens Ausgabe, USD / 1 Mio. Tokens
GPT-5.6 Sol 4,00 20,00
GPT-6 Sol 2,00 10,00
GPT-5.6 Luna 0,20 1,20
GPT-6 Luna 0,10 0,50

Zu den neuen Preisen kostet eine hypothetische Anfrage mit 100.000 ungecachten Eingabetokens und 10.000 abgerechneten Ausgabetokens bei Sol 0,30 US-Dollar statt 0,60 beim Vorgänger. Dieselben Tokenmengen kosten bei Luna 0,015 statt 0,032 US-Dollar. Das ist eine Berechnung aus der Preisliste, keine Messung des tatsächlichen Tokenbedarfs für eine Aufgabe.

Für Agenten ist dieser Unterschied wichtig, weil ein günstigeres Modell die Ersparnis durch zusätzliche Versuche aufbrauchen kann. Auch lange Kontexte verändern die Rechnung: OpenAI berechnet höhere Preise, sobald die Eingabe 272.000 Tokens überschreitet. Ich würde Rechnungen für die Größen meiner tatsächlichen Anfragen vergleichen, statt die Einstiegspreise überall vorauszusetzen. [2]

Das ist der wirtschaftliche Grund, das von mir beobachtete Over-Engineering bei GPT-5.6 Sol erneut zu prüfen. Günstigere Tokens verbilligen einen unnötigen Umweg, machen ihn aber nicht sinnvoll. Auch das neue Modell muss die Konventionen des Repositorys beachten und aufhören, sobald der Auftrag erledigt ist.

Zeigen die GPT-6-Benchmarks einen großen Fortschritt?

Die unabhängigen Ergebnisse zeigen eine kleine Änderung im Gesamtindex und einen deutlicheren Zugewinn bei Sols Terminalarbeit. Artificial Analysis zeigt im Intelligence Index v4.3.2 für Sol 48 statt 47 an, während Luna gerundet bei 37 bleibt. Alle vier Einträge verwenden maximalen Denkaufwand. Das sind gerundete Indexpunkte, keine Prozentwerte gelöster Aufgaben; ungerundet betragen die Änderungen etwa +0,55 für Sol und -0,07 für Luna. [4] [5] [6] [7]

ModellfamilieGPT-5.6GPT-6Änderung des angezeigten Werts
Sol4748+1 Punkt
Luna37370 Punkte

Das bedeutet nicht, dass jede Aufgabe unverändert ausfällt. Im Terminal-Bench-4.0-Test von Artificial Analysis steigt Sol von 39,9 % auf 43,9 %. Der Anbieter verwendet mini-swe-agent für 66 Terminalaufgaben und mittelt die Erfolgsquote einzelner Versuche über drei Wiederholungen. In diesem Aufbau sind das vier Prozentpunkte mehr. [3]

Daten als Tabelle anzeigen
Benchmark GPT-6 SolGPT-5.6 Sol
Terminal-Bench 4.0 43,9 %39,9 %
Abbildung 1. Artificial Analysis, Terminal-Bench 4.0, maximaler Denkaufwand. Abgerufen am 22. September 2026. [3]

Die Fortschritte sind ungleich verteilt. Auf GDPval-AA v2.1 von Artificial Analysis, das die Qualität von Arbeitsergebnissen vergleicht, fällt Sol von 1.588 auf 1.487 Elo und Luna von 1.443 auf 1.367. Elo ist eine relative Bewertung aus Vergleichen zwischen Ausgaben; das sind also keine Verluste in Prozentpunkten. Diese Ergebnisse sprechen dafür, benötigte Dokumente und Analysen selbst zu prüfen, statt jede GPT-6-Ausgabe automatisch für besser zu halten. [13]

Sols Terminalgewinn ist damit interessanter als die kleine Indexänderung, doch die Veröffentlichung gewinnt nicht in allen Tests. Luna würde ich keinen Terminalwert zuweisen, der in diesem Vergleich fehlt. OpenAIs Modellleitfaden beschreibt besseres Programmieren, höhere faktische Zuverlässigkeit und klarere Kommunikation; die für diesen Artikel geprüften offiziellen Quellen liefern jedoch keinen Zahlenvergleich mit beiden Vorgängern. [8]

Einen größeren unabhängigen Coding-Zuwachs gibt es bei der separaten Veröffentlichung von Opus 5.5. Für Sol und Luna ist die Kombination aus diesen Ergebnissen und niedrigeren Preisen überzeugender: brauchbare Fähigkeiten zu geringeren Tokenkosten.

Kannst du Sol und Luna in ChatGPT nutzen?

Die neuen Modelle werden in ChatGPT Work und Codex ausgerollt, nicht im normalen Chat. OpenAIs Changelog nennt diese Bereiche ausdrücklich. Fehlt GPT-6 Sol in der Modellauswahl von Chat, ist das allein also kein Zeichen eines fehlgeschlagenen Rollouts. [1]

Diese Produktunterscheidung geht leicht verloren, wenn aus der Veröffentlichung einfach „ChatGPT 6“ wird. Sol und Luna sind Modellnamen; innerhalb von ChatGPT gibt es verschiedene Bereiche für Modelle. Außerdem folgen sie auf die frühere Veröffentlichung von GPT-6 Astra. Astra ist kein weiteres Modell, das am 22. September neu erschienen ist.

Mitten in einer langen Aufgabe ist dieser Unterschied wichtiger als ein Tokenrabatt. Ein Abo kann ein kürzeres Nutzungslimit durchsetzen, obwohl das Wochenkontingent noch Platz hat, wie ich beim Fünfstundenlimit von Codex Plus beschrieben habe. Deshalb würde ich API-Berechnungen und Erfahrungen mit Abos bei der Bewertung getrennt halten.

Was fällt Reddit-Nutzern auf?

Die ersten Reddit-Threads zeigen Begeisterung über die Preise und widersprüchliche Erfahrungen mit der praktischen Qualität. Es sind Berichte vom Veröffentlichungstag am 22. September mit unterschiedlichen Aufgaben und Denkstufen. Einen eigenen kontrollierten Vergleich habe ich für diesen Artikel nicht durchgeführt.

In r/codex berichtet eine Person von einem vielversprechenden erzeugten Plan, der 1 % ihres Fünfstundenkontingents verbraucht habe, und nennt ausdrücklich eine Stichprobe von einem Versuch. Im selben Thread bevorzugt jemand das frühere Luna, während ein Sol-Nutzer zu viele Links und Dokumentpfade in Antworten kritisiert. Das sind sinnvolle Prüfpunkte, aber kein Nachweis eines typischen Verbrauchs. [9]

Der Release-Thread zeigt dieselbe Spaltung: Eine Person lobt Luna bei maximalem Aufwand und geringem Verbrauch, eine andere berichtet von einer schlechten Erfahrung. Manche Kommentare beschreiben Zugriffsfehler während des Rollouts. Auf r/OpenAI stehen Lob für niedrigere Preise und Beschwerden über die fehlende Verfügbarkeit im normalen Chat nebeneinander. [10] [11]

Als Nächstes würde ich die Aufgaben trennen. OpenAI empfiehlt, Sol mit mittlerem und Luna mit hohem Denkaufwand zu beginnen, und sieht Luna bei klar begrenzten Aufgaben wie Extraktion, Klassifikation und strukturierten Zusammenfassungen. Das ist ein sinnvoller Ausgangspunkt für einen Vergleich, statt überall das Maximum einzustellen und auf die Verbrauchsanzeige zu schauen. [8]

Ich würde Sol eine bekannte Repository-Änderung und Luna eine klar definierte Umwandlung geben. Dann würde ich akzeptierte Ergebnisse, Korrekturen und tatsächliche Kosten mit den Vorgängern vergleichen. Die Preissenkung ist bereits dokumentiert. Ob sie mehr erledigte Arbeit ermöglicht, wäre die nächste Messung.

Quellen

  1. GPT-6 Sol and Luna rolloutOpenAI, Codex changelog · 2026-09-22
  2. API pricingOpenAI Developers
  3. Terminal-Bench 4.0Artificial Analysis
  4. GPT-6 Sol model analysisArtificial Analysis
  5. GPT-5.6 Sol model analysisArtificial Analysis
  6. GPT-6 Luna model analysisArtificial Analysis
  7. GPT-5.6 Luna model analysisArtificial Analysis
  8. ModelsOpenAI, Codex docs
  9. Anyone tried GPT-6 Sol yet?Reddit, r/codex · 2026-09-22
  10. GPT 6 droppedReddit, r/codex · 2026-09-22
  11. Introducing GPT-6 Sol and LunaReddit, r/OpenAI · 2026-09-22
  12. Pricing and usage limitsOpenAI, Codex docs
  13. GDPval-AA v2.1Artificial Analysis