KI News 7 Min. Lesezeit

GPT-6.1 Sol: kleiner Versionssprung, großer Satz im Index

GPT-6.1 Sol kommt sieben Tage nach GPT-6 Sol, zum gleichen Tokenpreis und mit halbiertem Cache-Preis. Ich hätte das fast als Iteration abgehakt. Artificial Analysis misst allerdings bis zu acht Punkte mehr, am deutlichsten auf Low und Medium.

Laptop auf Schreibtisch zeigt das OpenAI-Modell GPT-6.1 Sol mit leuchtender Sonne auf dem Display.

OpenAI hat am 29. September auf dem DevDay GPT-6.1 Sol vorgestellt, genau eine Woche nachdem GPT-6 Sol und Luna mit halbierten API-Preisen rausgekommen sind. Soweit ich es überblicke, hat noch kein Modell aus OpenAIs Hauptlinie so schnell einen Nachfolger bekommen. Der Tokenpreis bleibt, der Cache wird billiger, und laut OpenAI rückt Sol damit nah an das Flaggschiff GPT-6 Astra heran.

Auffällig ist wieder das Timing, denn Anthropic hatte einen Tag vorher Claude Sonnet 5.5 veröffentlicht. Nach Versionsnummer und Preisliste hätte ich das Ganze als Iteration abgehakt – von 6 auf 6.1, gleicher Preis, weiter im Text. Artificial Analysis sieht das anders, zumindest auf den unteren und mittleren Effort-Stufen.

TL;DR

GPT-6.1 Sol kostet weiter 2 $ / 10 $ pro 1 Mio. Tokens, gecachter Input sinkt auf 0,10 $. Im Artificial-Analysis-Index legt das Modell auf allen Effort-Stufen zu, am deutlichsten auf Low und Medium.

  • Erschienen am 29. September, sieben Tage nach GPT-6 Sol und einen Tag nach Claude Sonnet 5.5.
  • Artificial Analysis: 52 statt 48 Punkte auf Max, 48 statt 40 auf Medium – bei gleichen oder niedrigeren Kosten pro Index-Task.
  • In der API fällt die Effort-Stufe none weg, Tool Calling gibt es nur über die Responses API.
  • Die deutsche OpenAI-Seite klingt beim Tempo-Tarif Ultrafast weiter, als Original und Preisliste es hergeben.

Sieben Tage, zwei Releases, ein bekanntes Muster

Das Muster kennt man seit letzter Woche. Am 22. September erschien GPT-6 Sol am selben Tag wie Claude Opus 5.5, und OpenAI verglich in den eigenen Charts noch mit Opus 5. Diesmal erwischt es Anthropic. In der Benchmark-Tabelle zu Sonnet 5.5 vom 28. September steht GPT-6 Sol als Vergleichsmodell – ein Modell, das am nächsten Tag schon nicht mehr OpenAIs aktuelles Sol war.

Wer da auf wen reagiert, lässt sich von außen ganz schwer sagen. Einen DevDay setzt niemand am Vorabend an, und man kann das Timing genauso gut umgekehrt lesen: Anthropic hat seinen Release einen Tag vor OpenAIs Entwicklerkonferenz platziert (was ich aktuell für am Wahrscheinlichsten halte). Als Anwender bleibt vor allem hängen, dass Vergleichstabellen inzwischen eine Halbwertszeit von ungefähr einem Tag haben.

Gleicher Preis, halbierter Cache

Am Tokenpreis ändert sich nichts. GPT-6.1 Sol kostet laut API-Preisliste im Standard-Tarif 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, genau wie der Vorgänger. Neu ist der Preis für gecachten Input, der von 0,20 $ auf 0,10 $ fällt. Das sind 95 % Rabatt auf den regulären Input und die Hälfte dessen, was GPT-6 Sol für den Cache nimmt. Cache-Writes kosten unverändert 2,50 $, also das 1,25-Fache des Input-Preises. Bei mehr als 272.000 Input-Tokens greift wie gehabt der Long-Context-Tarif mit doppeltem Input- und Cache-Preis und dem 1,5-fachen Outputpreis für den gesamten Request.

Für Agenten, die bei jedem Schritt denselben Kontext mitschicken, ist der Cache der eigentliche Hebel. OpenAIs Hauptargument zielt trotzdem auf Astra, das mit 10 $ / 50 $ genau fünfmal so viel kostet wie Sol.

Auf der Modellseite stehen ein paar Details, die für Pipelines wichtiger sind als die Benchmarks: Das Kontextfenster bleibt bei 1,05 Mio. Tokens mit maximal 128.000 Output-Tokens, der Knowledge Cutoff rückt vom 20. auf den 30. April 2026. Zehn Tage mehr Weltwissen, immerhin. Interessant wird es beim Reasoning Effort, denn GPT-6.1 Sol kennt nur noch low, medium, high, xhigh und max – die Stufe none, die GPT-6 Sol noch hatte, fällt weg (das kennen wir bereits von Astra).

Das hat da eine dezente Nebenwirkung; Bei GPT-6 Sol lief Function Calling über Chat Completions noch, solange reasoning_effort auf none stand. Bei GPT-6.1 Sol gibt es Tool Calling nur über die Responses API, Chat Completions funktioniert ohne Tools. Wer einfach die Model-ID tauscht, bekommt an genau dieser Stelle Ärger. Für Teams mit Datenschutz-Auflagen gibt es dafür EU-Datenresidenz, allerdings ohne Fast Mode.

In der Flaggschiff-Tabelle der Preisliste hat GPT-6.1 Sol den Vorgänger schon ersetzt. Eine Abschaltung von gpt-6-sol kündigt die Deprecations-Seite bisher nicht an. Für allgemein verfügbare Modelle nennt OpenAI dort mindestens sechs Monate Vorlauf – es sei denn, Sicherheits- oder Compliance-Gründe verlangen eine kürzere Frist.

Herstellerzahlen, diesmal gegen Opus 5.5

Die Benchmark-Sektion folgt dem Muster der Vorwoche. Fast jede Zahl kommt mit einem Kostenvergleich, absolute Scores sind rar. Immerhin vergleicht OpenAI diesmal mit Opus 5.5 und nicht mit dessen Vorgänger. Im Launch-Post stehen unter anderem diese Vergleiche:

  • DeepSWE 1.1: gleichauf mit Astra zu rund einem Fünftel der Kosten, 6,4 Prozentpunkte über dem besten Wert von GPT-6 Sol – bei geringerem Reasoning-Aufwand
  • AutomationBench 1.0.6 auf Medium: 2,2 Prozentpunkte vor Opus 5.5 zu rund einem Drittel der Kosten, 4,8 Prozentpunkte über GPT-6 Sol
  • OSWorld 2.0 offline auf Max: 7 Prozentpunkte vor GPT-6 Sol zu weniger als der Hälfte der Kosten, 2,1 Prozentpunkte hinter Astra zu rund einem Siebtel
  • Terminal-Bench Science 0.1 auf Max: mehr als doppelt so hoher Score wie bei GPT-6 Sol, 5,47 $ pro Task gegenüber 23,21 $ bei Opus 5.5 und 23,80 $ bei Astra

Den Spitzenwert bei Terminal-Bench Science hält mit 68,1 % weiter Astra. Den absoluten Score von GPT-6.1 Sol nennt der Fließtext nicht, und für die Einordnung wäre mir eine Zahl lieber als „mehr als das Doppelte“. Das sind – man kennt das bereits – herstellereigene Messungen, die Konkurrenzwerte stammen laut Fußnote aus öffentlichen Reports. Einen gemeinsamen, unabhängigen Testlauf ersetzt das nicht.

Die deutsche Fassung setzt eigene Akzente

Ich habe den Post zuerst auf Deutsch gelesen und dann das englische Original danebengelegt. An zwei Stellen erzählen die beiden nicht ganz dieselbe Geschichte.

Bei der Faktentreue setzen die Fassungen unterschiedliche Schwerpunkte. Die deutsche Seite nennt auf xhigh 4,1 % fehlerhafte Antworten, gegenüber 4,5 % beim Vorgänger und 4,0 % bei Astra. Das englische Original stellt dagegen Low nach vorne, wo die Quote von 11,4 auf 7,7 % sinkt. Das sind unterschiedliche Effort-Stufen und kein belegter Widerspruch, nur eben eine andere Auswahl fürs Schaufenster. (Beide Werte stammen aus bewusst schwierigen Testfällen, in denen Nutzer vorher einen Fehler gemeldet hatten. Mit der Fehlerquote im Alltag hat das wenig zu tun.)

Richtig schief wird es beim Tempo-Tarif Ultrafast. Die deutsche Seite klingt so, als sei GPT-6.1 Sol Ultrafast schon verfügbar, mit bis zu achtfachem Tempo zu ungefähr den bisherigen Astra-Kosten. Das englische Original kündigt Ultrafast für Sol erst für die nächsten Tage an, und der DevDay-Rückblick führt es noch als „coming soon“. Für den Tarif insgesamt nennt er bis zu sechsfache Token-Generierung in der API und bis zu achtfache in Codex. Gemeint ist das Token-Tempo, nicht die gesamte Bearbeitungszeit eines Tasks. In der Preisliste steht unter Ultrafast bislang nur Astra, deshalb halte ich mich an Original und Preisliste, Stand 30. September. Den Sol-Preis aus der deutschen Fassung würde ich bis dahin nicht als Tarif verbuchen.

Artificial Analysis: Der Sprung von GPT-6.1 Sol sitzt unten und in der Mitte

Die unabhängigen Zahlen von Artificial Analysis sind der Teil, der meine Iterations-These ins Wanken bringt. Im Intelligence Index v4.3.2 legt GPT-6.1 Sol auf allen fünf gemeinsamen Effort-Stufen zu, am deutlichsten auf Low und Medium. Medium ist zugleich die Voreinstellung in der API, was genau diese Zeile für den ersten eigenen Test interessant macht.

Effort GPT-6 Sol GPT-6.1 Sol Kosten pro Index-Task (6 → 6.1)
Max48521,05 $ → 0,72 $
Xhigh44510,52 $ → 0,39 $
High43500,38 $ → 0,32 $
Medium40480,25 $ → 0,21 $
Low34420,13 $ → 0,13 $

Stand 30.09.2026. Die Kosten pro Index-Task sind ein gewichteter Durchschnitt über die Index-Aufgaben, kein allgemeiner API-Preis.

Die so richtig interessante Zeile ist aber Medium: GPT-6.1 Sol erreicht dort mit 48 Punkten genau den Max-Wert des Vorgängers, für 0,21 $ statt 1,05 $ pro Index-Task, also für ein Fünftel. Zur Erinnerung: Beim Wechsel von GPT-5.6 Sol auf GPT-6 Sol hatte sich der Max-Wert um einen Punkt bewegt. Die volle Generationsnummer brachte einen Punkt, die Nachkommastelle bringt vier auf Max und sieben bis acht darunter.

Astra liegt auf Max mit 53 Punkten nur noch einen gerundeten Indexpunkt vor Sol. Das stützt das „near-Astra“ aus dem Marketing zumindest in diesem Gesamtindex.

Und weil der Anthropic-Release vom Vortag ohnehin danebensteht, ein kurzer Blick rüber: Sonnet 5.5 erreicht bei Artificial Analysis auf High 47 Punkte bei 1,08 $ pro Index-Task und auf Max 56 Punkte, getestet jeweils in der Konfiguration mit Anthropics Standard-Fallback. Auf Max liegt Sonnet in diesem Index also vor Sol. Auf High liefert GPT-6.1 Sol mit 50 Punkten für 0,32 $ den günstigeren Messpunkt, wobei gleich benannte Effort-Stufen zwischen zwei Herstellern nicht bedeuten, dass beide gleich viel rechnen.

Das Warten auf die erste Antwort

Weniger erfreulich ist die Latenz. Artificial Analysis weist für die Zeit bis zum ersten Antwort-Token auf Low 2,12 Sekunden aus, auf Medium 5,72, auf High knapp 58, auf Xhigh knapp 109 und auf Max fast 273 Sekunden – die Thinking-Zeit eingerechnet. Das sind Kennwerte aus den Testbedingungen von Artificial Analysis und keine feste Wartezeit für jeden Request. Mit rund 59 bis 66 Tokens pro Sekunde liegt das Modell außerdem unter dem Median vergleichbarer Modelle von knapp 71.

Für einen Agenten-Loop, der viele kurze Schritte schnell abarbeiten soll, wäre Max damit für mich kein naheliegender Ausgangspunkt. Gegenüber Xhigh bringt die Stufe einen weiteren gerundeten Indexpunkt, kostet pro Index-Task rund 85 % mehr und steht beim ausgewiesenen Latenzwert bei gut viereinhalb Minuten. Ob sich das für einen konkreten Workflow rechnet, würde ich im eigenen Setup prüfen (und mir vorher einen Kaffee holen).

Iteration? Nach der Versionsnummer schon

Ich hätte GPT-6.1 Sol nach Versionsnummer und Preisliste erstmal als Iteration einsortiert und bei Preis und Kontextfenster trägt das auch, im Index aber nicht. OpenAI selbst spricht im DevDay-Rückblick von einem großen Upgrade – eine Selbstbeschreibung, die ich im Normalfall unter Marketing wegsortiert hätte. Aber: hier stützen die unabhängigen Zahlen jene Selbstbeschreibung zumindest auf den unteren und mittleren Stufen.

Hotter Take: Versionsnummern sagen bei OpenAI gerade wenig darüber, wie groß ein Schritt tatsächlich ist. Letzte Woche kam eine neue Generation mit einem Punkt Plus, diese Woche eine Nachkommastelle mit acht.

Wer GPT-6 Sol produktiv einsetzt, sollte vor dem Wechsel alle Requests suchen, die reasoning.effort auf none setzen. Bei Chat Completions heißt der Parameter reasoning_effort, also am besten nach beidem greppen, und gleich mit nach Tool-Aufrufen über Chat Completions. Danach würde ich Medium und High im eigenen Harness gegen den bisherigen Stand laufen lassen, bevor ich mich auf die Evals des Herstellers verlasse.

Eigentlich wollte ich GPT-6.1 Sol heute schon in Codex mit ganz klassischem Kram testen – so einem frischen Astro-Stack ohne Altlasten. Dazu bin ich nicht gekommen, dann eben morgen.

Bis dahin lasse ich das so stehen, mit der Erkenntnis, dass eine .1 manchmal mehr bewegt als eine 6.

Artikel teilen: