GPT-6 Sol und Luna: halbe API-Preise, kaum Bewegung im unabhängigen Index
OpenAI bringt GPT-6 Sol und Luna und senkt die API-Preise deutlich. Der Artificial-Analysis-Index bewegt sich kaum, einzelne Task-Evals schon. Was davon für Agenten und Pipelines zählt.
OpenAI hat am 22. September GPT-6 Sol und GPT-6 Luna veröffentlicht, 19 Tage nach dem Flaggschiff GPT-6 Astra und quasi zeitgleich mit Opus 5.5. Die neuen Modelle greifen die Namen der entsprechenden GPT-5.6-Stufen auf und kosten in der API rund halb so viel. Ein GPT-6 Terra ist nicht dabei, die Mittelstufe der letzten Generation bleibt diesmal unbesetzt.
Die Ankündigung liest sich weniger wie ein Modell-Release, dafür mehr wie eine Preisliste mit angehängten Benchmarks und das ist auch die eigentliche Story. Im Artificial Analysis Intelligence Index bewegen sich Sol und Luna kaum; in einzelnen OpenAI-Evals schon.
TL;DR
GPT-6 Sol kostet 2 $ / 10 $, GPT-6 Luna 0,10 $ / 0,50 $ pro 1 Mio. Tokens. OpenAI spricht von 50 % niedrigeren Preisen; beim Luna-Output sind es rechnerisch 58 %. In den Konkurrenzvergleichen wird fast jeder Score um einen Kostenvergleich ergänzt.
- Kein GPT-6 Terra – zwei Stufen statt drei unterhalb von Astra.
- Artificial Analysis, Stand 22.09.2026: Luna 37 Punkte, Vorgänger 37; Sol 48, Vorgänger 47.
- Mehrere Alignment-Werte verbessern sich deutlich. Die Warning-Circumvention-Rate von Sol bleibt mit 64,4 % hoch.
- Die Modelle laufen in der API, in ChatGPT Work und in Codex; im normalen Chat sind sie noch nicht verfügbar.
Die Hälfte des Aktionspreises ist der neue API-Preis
Die Zahlen zuerst, weil sie der Kern der Meldung sind:
| Modell | Input | Output | Vorher (GPT-5.6) |
|---|---|---|---|
| GPT-6 Sol | 2 $ | 10 $ | 4 $ / 20 $ |
| GPT-6 Luna | 0,10 $ | 0,50 $ | 0,20 $ / 1,20 $ |
Preise pro 1 Mio. Tokens. OpenAI spricht durchgängig von „50 % günstiger“, beim Luna-Output sind es rechnerisch 58 %, was in der eigenen Tabelle großzügig abgerundet wird. Interessanter ist, womit OpenAI da eigentlich vergleicht. Die 4 $ / 20 $ für GPT-5.6 Sol sind ein Aktionspreis, den OpenAI laut Preisliste mindestens bis zum 21. November 2026 garantiert; regulär standen 5 $ / 30 $ auf der Liste. Luna hatte schon am 30. Juli eine dauerhafte Senkung von 1 $ / 6 $ auf 0,20 $ / 1,20 $ bekommen. Gegenüber den Launch-Preisen vom Juli kostet Sol also 60 bzw. 67 % weniger, Luna 90 bzw. 92 %.
Die aktuellen API-Preislisten führen für GPT-6 Sol und GPT-6 Luna 2 $ / 10 $ beziehungsweise 0,10 $ / 0,50 $ auf, ohne eine Befristung zu nennen. Mehr lässt sich aus der Primärquelle nicht ableiten. Bei Requests mit mehr als 272.000 Input-Tokens gelten außerdem die Long-Context-Tarife: doppelter Preis für Input und Cache sowie der 1,5-fache Outputpreis für den gesamten Request.
Astra bleibt bei 10 $ / 50 $ das Flaggschiff. Damit liegt zwischen Luna und Astra ein Faktor 100 beim Input, und OpenAI baut die komplette Argumentation um diese Spreizung herum.
Der zweite Hebel sitzt im Caching. Cache-Reads bekommen 90 % Rabatt, die Trefferquote soll per Default höher liegen. Und – das ist für alle relevant, die Agenten bauen – Reasoning-Effort und Tool-Set lassen sich jetzt mitten in einer Konversation ändern, ohne dass der bisherige Kontext aus dem Cache fliegt. Dazu kommen explizite Breakpoints, mit denen man festlegt, wo ein gecachter Prefix endet, plus ein Dashboard und ein Diagnose-Tool. GitHub liefert die passende Jubel-Zahl gleich mit: über 50 % weniger frisch zu verarbeitende Prompt-Tokens „across billions of requests“. Das darf man als Referenz eines Partners lesen, der die Modelle im eigenen Produkt vermarktet.
Kosten pro Task als neue Leitwährung
Wer die Benchmark-Sektion liest, merkt schnell, dass fast keine Zahl für sich allein steht. Fast jede kommt mit einem Kostenvergleich im Schlepptau.
Auf AutomationBench 1.0.6 von Zapier, einem Test über 47 Tools aus Sales, Marketing, Operations, Support, Finance und HR, erreicht Sol bei xhigh-Effort 33,2 % für 0,27 $ pro Task. Astra auf low kommt auf 30,3 % zu 3,9-fachen Kosten, Claude Opus 5 auf max auf 26,9 % zu 11,1-fachen Kosten. Claude Fable 5.1 mit Opus-5-Fallback liegt bei 31,4 %, allerdings ohne die Fallback-Kosten, die laut OpenAI-Fußnote bei rund 40 % der Tasks anfielen. Luna auf high verbessert sich um 5,4 Prozentpunkte gegenüber GPT-5.6 Luna bei 58 % geringeren Kosten pro Task.
Beim Coding sieht das Muster gleich aus. Auf DeepSWE 1.1 erreicht Sol auf max 68,8 % und liegt damit 1,1 Punkte hinter Fable 5 auf xhigh (69,9 %), zu rund 80 % geringeren Kosten. Luna auf max schafft 66,6 %, was OpenAI mit Opus 5 und Fable 5 auf medium vergleicht, zu 93 beziehungsweise 96 % weniger Kosten. Bei Computer Use auf OSWorld 2.0 offline steht Sol xhigh mit 60,5 % neben Opus 5 medium mit 60,3 %, wieder rund 80 % günstiger.
Bevor man diese Zahlen als Ranking liest, hier der kleine Haken: In den Konkurrenz-Charts vergleicht OpenAI ausgewählte Effort-Stufen des eigenen Modells mit ausgewählten Effort-Stufen der Konkurrenz. Sol auf xhigh gegen Opus auf medium ist eine legitime Kosten-Nutzen-Aussage, aber keine Antwort auf die Frage, welches Modell grundsätzlich besser ist.
Die Konkurrenzwerte stammen laut Fußnote aus öffentlich verfügbaren Reports. Wo keine Werte für Fable 5.1 vorlagen, setzte OpenAI Werte von Fable 5 ein. OpenAIs Angaben zu den eigenen Modellen sind herstellereigene Messungen; die Konkurrenzwerte wurden aus anderen Veröffentlichungen übernommen. Ein einheitlicher unabhängiger Testlauf ist das nicht.
Die Factuality-Verbesserung kommt im Fließtext ohne absolute Zahlen aus. Sol macht laut OpenAI etwa halb so viele Fehler wie der Vorgänger. Luna erreicht bei höheren Effort-Stufen das Niveau von GPT-5.6 Sol zu etwa einem Hundertstel der Kosten. Grundlage ist ein internes Eval mit de-identifizierten ChatGPT-Gesprächen, in denen Nutzer Fehler gemeldet hatten. Das ist ein sinnvolles Testset, aber eines, das nur OpenAI besitzt.
Alignment: viel Fortschritt, ein hartnäckiger Ausreißer
OpenAI stellt die Alignment-Evals prominent hin. In der interaktiven Grafik sinkt die Coding-Deception-Rate von 10,4 auf 1,3 %. Beim absichtlich defekten Such-Tool fällt die Non-Disclosure-Rate bei Sol von 77,5 auf 4,9 %, bei Luna von 78,3 auf 28,7 %. Unter den Läufen, in denen das präparierte Message-Board gefunden wurde, führt GPT-6 Sol die dort platzierte unautorisierte Anweisung in 11,3 % der Fälle aus; GPT-5.6 Sol lag bei 51,9 %.
Und dann ist da die Warning Circumvention. Trifft GPT-6 Sol auf eine ausdrückliche Sperre, versucht das Modell in 64,4 % der Läufe, sie zu umgehen. Der Vorgänger lag bei 68,2 %. GPT-6 Luna fällt von 76,5 auf 42,4 %. Fast zwei von drei Sol-Läufen enthalten also weiterhin einen Umgehungsversuch.
OpenAI weist darauf hin, dass die Tests überwiegend risikoarme Situationen ohne die vollständigen produktseitigen Safeguards abbilden. Die Werte stehen im entsprechenden Alignment-Tab; für die ausführlichen Ergebnisse verweist OpenAI auf die System Card.
Wo GPT-6 Sol und Luna laufen und wo nicht
OpenAI rollt Sol und Luna seit dem 22. September schrittweise in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu aus. Free- und Go-Nutzer bekommen Luna in der Desktop-App. Im normalen Chat sind beide noch nicht verfügbar. Einen Termin nennt OpenAI nicht. Anscheinend ist der Rollout aber recht fix dieses Mal, denn in meinem Account sprang mir die Meldung schon entgegen.
In der API heißen die Modelle gpt-6-sol und gpt-6-luna. Beide besitzen ein Kontextfenster von 1,05 Mio. Tokens bei maximal 128.000 Output-Tokens, nehmen Text und Bilder entgegen und kennen sechs Effort-Stufen von none bis max, medium ist Default. Der Knowledge Cutoff liegt bei Sol auf dem 20. April 2026, bei Luna auf dem 18. Mai 2026. Das billigere Modell ist also das aktuellere. Warum? Man weiß es nicht.
Der Preis springt, der Index kaum
Stand 22. September 2026 verwendet Artificial Analysis den Intelligence Index v4.3.2 mit zehn Evals. GPT-6 Luna auf max erreicht dort 37 Punkte. GPT-5.6 Luna: ebenfalls 37. GPT-6 Sol auf max steht bei 48, der Vorgänger bei 47. GPT-6 Astra liegt bei 53.
Der gerundete Gesamtindex bewegt sich bei Luna und Sol also um null beziehungsweise einen Punkt. Das beweist nicht, dass sich „die Intelligenz“ insgesamt nicht verbessert hat. Es ist aber ein sauberer Dämpfer für die Behauptung eines pauschalen Generationssprungs. Der sichtbare Sprung im Index kam mit Astra. Sol und Luna drücken vor allem den Preis; einzelne OpenAI-Evals zeigen dennoch Verbesserungen, die der Gesamtindex nicht abbildet.
Was OpenAI nicht steuern konnte, ist das Timing. Anthropic veröffentlichte am selben Tag Claude Opus 5.5 und senkte den Tokenpreis von 5 $ / 25 $ auf 4 $ / 20 $. Das macht OpenAIs Vergleiche mit Opus 5 nicht wertlos, aber der gewählte Konkurrent war am Erscheinungstag nicht mehr Anthropics aktuelles Opus-Modell. In den geprüften Quellen lag am 22. September noch kein unabhängiger direkter Vergleich mit Opus 5.5 vor.
Mein kleiner hotter Take für alle, die Agenten oder Pipelines betreiben: Die Preissenkung ist real, und bei langen Konversationen könnten die höhere Cache-Trefferquote und die stabilere Cache-Nutzung der größere Hebel sein. Wer bisher GPT-5.6 Luna nutzt, bekommt mit GPT-6 Luna ein neues Modell zum rund halbierten Tokenpreis – im Artificial-Analysis-Index allerdings mit demselben gerundeten Max-Score. Vor einem Wechsel zu Sol würde ich Luna deshalb im eigenen Harness auf max testen. Wer aus OpenAIs Charts einen pauschalen Intelligenzsprung ableitet, liest Kostenvergleiche als Modell-Ranking.
Produktiv laufen die beiden bei mir noch nirgends, was sich heute ändert. Ich werde Sol und Luna im Büro an diversen Projekten durchtesten, und zwar nicht im Sandkasten. Nur eben nicht in laufenden Pipelines oder Loops, die in Produktion hängen, sondern für Code und Analyse, wo ein Fehlgrif eher Zeit kostet, aber keinen Kunden.