> ## Content Index
> Fetch the complete content index at: https://t01.li/llms.txt
> Use this file to discover other available public pages before exploring further.

# GPT-6.1 Sol: kleiner Versionssprung, großer Satz im Index
- URL: https://t01.li/ki-news/gpt-6-1-sol-artificial-analysis-api-preis/
- Published: 2026-09-30T12:00:00.000Z
- Updated: 2026-09-30T15:14:12.000Z
- Description: GPT-6.1 Sol kommt sieben Tage nach GPT-6 Sol, zum gleichen Tokenpreis und mit halbiertem Cache-Preis. Ich hätte das fast als Iteration abgehakt. Artificial Analysis misst allerdings bis zu acht Punkte mehr, am deutlichsten auf Low und Medium.
- Author: Tobias Glawe
- Tags: KI News

OpenAI hat am 29\. September auf dem DevDay [*GPT-6.1 Sol* vorgestellt](https://openai.com/index/introducing-gpt-6-1-sol/?ref=t01.li), genau eine Woche nachdem [*GPT-6 Sol* und *Luna* mit halbierten API-Preisen](https://t01.li/ki-news/gpt-6-sol-luna-openai-halbiert-api-preise/) rausgekommen sind. Soweit ich es überblicke, hat noch kein Modell aus OpenAIs Hauptlinie so schnell einen Nachfolger bekommen. Der Tokenpreis bleibt, der Cache wird billiger, und laut OpenAI rückt Sol damit nah an das Flaggschiff [*GPT-6 Astra*](https://t01.li/ki-news/gpt-6-astra-vs-gpt-5-6-sol/) heran.

Auffällig ist wieder das Timing, denn Anthropic hatte einen Tag vorher *Claude Sonnet 5.5* veröffentlicht. Nach Versionsnummer und Preisliste hätte ich das Ganze als Iteration abgehakt – von 6 auf 6.1, gleicher Preis, weiter im Text. Artificial Analysis sieht das anders, zumindest auf den unteren und mittleren Effort-Stufen.

## TL;DR 

*GPT-6.1 Sol* kostet weiter 2 $ / 10 $ pro 1 Mio. Tokens, gecachter Input sinkt auf 0,10 $. Im Artificial-Analysis-Index legt das Modell auf allen Effort-Stufen zu, am deutlichsten auf Low und Medium.

- Erschienen am 29\. September, sieben Tage nach *GPT-6 Sol* und einen Tag nach *Claude Sonnet 5.5*.
- Artificial Analysis: 52 statt 48 Punkte auf Max, 48 statt 40 auf Medium – bei gleichen oder niedrigeren Kosten pro Index-Task.
- In der API fällt die Effort-Stufe `none` weg, Tool Calling gibt es nur über die Responses API.
- Die deutsche OpenAI-Seite klingt beim Tempo-Tarif Ultrafast weiter, als Original und Preisliste es hergeben.

## Sieben Tage, zwei Releases, ein bekanntes Muster

Das Muster kennt man seit letzter Woche. Am 22\. September erschien *GPT-6 Sol* am selben Tag wie [*Claude Opus 5.5*](https://t01.li/ki-news/claude-opus-5-5-fable-niveau-40-prozent-guenstiger/), und OpenAI verglich in den eigenen Charts noch mit *Opus 5*. Diesmal erwischt es Anthropic. In der [Benchmark-Tabelle zu *Sonnet 5.5*](https://www.anthropic.com/claude-sonnet-5-5?ref=t01.li) vom 28\. September steht *GPT-6 Sol* als Vergleichsmodell – ein Modell, das am nächsten Tag schon nicht mehr OpenAIs aktuelles Sol war.

Wer da auf wen reagiert, lässt sich von außen ganz schwer sagen. Einen DevDay setzt niemand am Vorabend an, und man kann das Timing genauso gut umgekehrt lesen: Anthropic hat seinen Release einen Tag vor OpenAIs Entwicklerkonferenz platziert (was ich aktuell für am Wahrscheinlichsten halte). Als Anwender bleibt vor allem hängen, dass Vergleichstabellen inzwischen eine Halbwertszeit von ungefähr einem Tag haben.

## Gleicher Preis, halbierter Cache

Am Tokenpreis ändert sich nichts. *GPT-6.1 Sol* kostet laut [API-Preisliste](https://developers.openai.com/api/docs/pricing?ref=t01.li) im Standard-Tarif 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, genau wie der Vorgänger. Neu ist der Preis für gecachten Input, der von 0,20 $ auf 0,10 $ fällt. Das sind 95 % Rabatt auf den regulären Input und die Hälfte dessen, was *GPT-6 Sol* für den Cache nimmt. Cache-Writes kosten unverändert 2,50 $, also das 1,25-Fache des Input-Preises. Bei mehr als 272.000 Input-Tokens greift wie gehabt der Long-Context-Tarif mit doppeltem Input- und Cache-Preis und dem 1,5-fachen Outputpreis für den gesamten Request.

Für Agenten, die bei jedem Schritt denselben Kontext mitschicken, ist der Cache der eigentliche Hebel. OpenAIs Hauptargument zielt trotzdem auf *Astra*, das mit 10 $ / 50 $ genau fünfmal so viel kostet wie Sol.

Auf der [Modellseite](https://developers.openai.com/api/docs/models/gpt-6.1-sol?ref=t01.li) stehen ein paar Details, die für Pipelines wichtiger sind als die Benchmarks: Das [Kontextfenster](https://t01.li/glossar/#kontextfenster) bleibt bei 1,05 Mio. Tokens mit maximal 128.000 Output-Tokens, der Knowledge Cutoff rückt vom 20\. auf den 30\. April 2026\. Zehn Tage mehr Weltwissen, immerhin. Interessant wird es beim [Reasoning Effort](https://t01.li/glossar/#reasoning-effort), denn *GPT-6.1 Sol* kennt nur noch `low`, `medium`, `high`, `xhigh` und `max` – die Stufe `none`, die *GPT-6 Sol* noch hatte, fällt weg (das kennen wir bereits von [Astra](https://t01.li/ki-news/gpt-6-astra-vs-gpt-5-6-sol/)).

Das hat da eine dezente Nebenwirkung; Bei [*GPT-6 Sol*](https://developers.openai.com/api/docs/models/gpt-6-sol?ref=t01.li) lief Function Calling über Chat Completions noch, solange `reasoning_effort` auf `none` stand. Bei *GPT-6.1 Sol* gibt es [Tool Calling](https://t01.li/glossar/#tool-calling) nur über die Responses API, Chat Completions funktioniert ohne Tools. Wer einfach die Model-ID tauscht, bekommt an genau dieser Stelle Ärger. Für Teams mit Datenschutz-Auflagen gibt es dafür EU-Datenresidenz, allerdings ohne Fast Mode.

In der Flaggschiff-Tabelle der Preisliste hat *GPT-6.1 Sol* den Vorgänger schon ersetzt. Eine Abschaltung von `gpt-6-sol` kündigt die [Deprecations-Seite](https://developers.openai.com/api/docs/deprecations?ref=t01.li) bisher nicht an. Für allgemein verfügbare Modelle nennt OpenAI dort mindestens sechs Monate Vorlauf – es sei denn, Sicherheits- oder Compliance-Gründe verlangen eine kürzere Frist.

## Herstellerzahlen, diesmal gegen Opus 5.5

Die Benchmark-Sektion folgt dem Muster der Vorwoche. Fast jede Zahl kommt mit einem Kostenvergleich, absolute Scores sind rar. Immerhin vergleicht OpenAI diesmal mit *Opus 5.5* und nicht mit dessen Vorgänger. Im [Launch-Post](https://openai.com/index/introducing-gpt-6-1-sol/?ref=t01.li) stehen unter anderem diese Vergleiche:

- [DeepSWE 1.1](https://deepswe.datacurve.ai/?ref=t01.li): gleichauf mit *Astra* zu rund einem Fünftel der Kosten, 6,4 Prozentpunkte über dem besten Wert von *GPT-6 Sol* – bei geringerem Reasoning-Aufwand
- [AutomationBench 1.0.6](https://zapier.com/benchmarks?ref=t01.li) auf Medium: 2,2 Prozentpunkte vor *Opus 5.5* zu rund einem Drittel der Kosten, 4,8 Prozentpunkte über *GPT-6 Sol*
- [OSWorld 2.0](https://osworld-v2.xlang.ai/?ref=t01.li) offline auf Max: 7 Prozentpunkte vor *GPT-6 Sol* zu weniger als der Hälfte der Kosten, 2,1 Prozentpunkte hinter *Astra* zu rund einem Siebtel
- [Terminal-Bench Science 0.1](https://www.terminal-bench-science.ai/?ref=t01.li) auf Max: mehr als doppelt so hoher Score wie bei *GPT-6 Sol*, 5,47 $ pro Task gegenüber 23,21 $ bei *Opus 5.5* und 23,80 $ bei *Astra*

Den Spitzenwert bei Terminal-Bench Science hält mit 68,1 % weiter *Astra*. Den absoluten Score von *GPT-6.1 Sol* nennt der Fließtext nicht, und für die Einordnung wäre mir eine Zahl lieber als „mehr als das Doppelte“. Das sind – man kennt das bereits – herstellereigene Messungen, die Konkurrenzwerte stammen laut Fußnote aus öffentlichen Reports. Einen gemeinsamen, unabhängigen Testlauf ersetzt das nicht.

### Die deutsche Fassung setzt eigene Akzente

Ich habe den Post zuerst auf Deutsch gelesen und dann das englische Original danebengelegt. An zwei Stellen erzählen die beiden nicht ganz dieselbe Geschichte.

Bei der Faktentreue setzen die Fassungen unterschiedliche Schwerpunkte. Die [deutsche Seite](https://openai.com/de-DE/index/introducing-gpt-6-1-sol/?ref=t01.li) nennt auf xhigh 4,1 % fehlerhafte Antworten, gegenüber 4,5 % beim Vorgänger und 4,0 % bei *Astra*. Das [englische Original](https://openai.com/index/introducing-gpt-6-1-sol/?ref=t01.li) stellt dagegen Low nach vorne, wo die Quote von 11,4 auf 7,7 % sinkt. Das sind unterschiedliche Effort-Stufen und kein belegter Widerspruch, nur eben eine andere Auswahl fürs Schaufenster. (Beide Werte stammen aus bewusst schwierigen Testfällen, in denen Nutzer vorher einen Fehler gemeldet hatten. Mit der Fehlerquote im Alltag hat das wenig zu tun.)

Richtig schief wird es beim Tempo-Tarif Ultrafast. Die deutsche Seite klingt so, als sei *GPT-6.1 Sol Ultrafast* schon verfügbar, mit bis zu achtfachem Tempo zu ungefähr den bisherigen *Astra*\-Kosten. Das englische Original kündigt Ultrafast für Sol erst für die nächsten Tage an, und der [DevDay-Rückblick](https://openai.com/index/devday-2026-recap/?ref=t01.li) führt es noch als „coming soon“. Für den Tarif insgesamt nennt er bis zu sechsfache Token-Generierung in der API und bis zu achtfache in *Codex*. Gemeint ist das Token-Tempo, nicht die gesamte Bearbeitungszeit eines Tasks. In der Preisliste steht unter Ultrafast bislang nur *Astra*, deshalb halte ich mich an Original und Preisliste, Stand 30\. September. Den Sol-Preis aus der deutschen Fassung würde ich bis dahin nicht als Tarif verbuchen.

## Artificial Analysis: Der Sprung von GPT-6.1 Sol sitzt unten und in der Mitte

Die unabhängigen Zahlen von [Artificial Analysis](https://artificialanalysis.ai/models/releases/gpt-6-1-sol?ref=t01.li) sind der Teil, der meine Iterations-These ins Wanken bringt. Im Intelligence Index v4.3.2 legt *GPT-6.1 Sol* auf allen fünf gemeinsamen Effort-Stufen zu, am deutlichsten auf Low und Medium. Medium ist zugleich die Voreinstellung in der API, was genau diese Zeile für den ersten eigenen Test interessant macht.

| Effort | [GPT-6 Sol](https://artificialanalysis.ai/models/releases/gpt-6-sol?ref=t01.li) | GPT-6.1 Sol | Kosten pro Index-Task (6 → 6.1) |
| ------ | ------------------------------------------------------------------------------- | ----------- | ------------------------------- |
| Max    | 48                                                                              | 52          | 1,05 $ → 0,72 $                 |
| Xhigh  | 44                                                                              | 51          | 0,52 $ → 0,39 $                 |
| High   | 43                                                                              | 50          | 0,38 $ → 0,32 $                 |
| Medium | 40                                                                              | 48          | 0,25 $ → 0,21 $                 |
| Low    | 34                                                                              | 42          | 0,13 $ → 0,13 $                 |

Stand 30.09.2026\. Die Kosten pro Index-Task sind ein gewichteter Durchschnitt über die Index-Aufgaben, kein allgemeiner API-Preis.

Die so richtig interessante Zeile ist aber Medium: *GPT-6.1 Sol* erreicht dort mit 48 Punkten genau den Max-Wert des Vorgängers, für 0,21 $ statt 1,05 $ pro Index-Task, also für ein Fünftel. Zur Erinnerung: Beim Wechsel von *GPT-5.6 Sol* auf *GPT-6 Sol* hatte sich der Max-Wert um einen Punkt bewegt. Die volle Generationsnummer brachte einen Punkt, die Nachkommastelle bringt vier auf Max und sieben bis acht darunter.

*Astra* liegt auf Max mit 53 Punkten nur noch einen gerundeten Indexpunkt vor Sol. Das stützt das „near-Astra“ aus dem Marketing zumindest in diesem Gesamtindex.

Und weil der Anthropic-Release vom Vortag ohnehin danebensteht, ein kurzer Blick rüber: [*Sonnet 5.5*](https://t01.li/ki-news/claude-sonnet-5-5-benchmarks-preis-agenten/) erreicht bei [Artificial Analysis](https://artificialanalysis.ai/models/releases/claude-sonnet-5-5?ref=t01.li) auf High 47 Punkte bei 1,08 $ pro Index-Task und auf Max 56 Punkte, getestet jeweils in der Konfiguration mit Anthropics Standard-Fallback. Auf Max liegt Sonnet in diesem Index also vor Sol. Auf High liefert *GPT-6.1 Sol* mit 50 Punkten für 0,32 $ den günstigeren Messpunkt, wobei gleich benannte Effort-Stufen zwischen zwei Herstellern nicht bedeuten, dass beide gleich viel rechnen.

### Das Warten auf die erste Antwort

Weniger erfreulich ist die Latenz. Artificial Analysis weist für die Zeit bis zum ersten Antwort-Token auf [Low](https://artificialanalysis.ai/models/gpt-6-1-sol-low?ref=t01.li) 2,12 Sekunden aus, auf [Medium](https://artificialanalysis.ai/models/gpt-6-1-sol-medium?ref=t01.li) 5,72, auf [High](https://artificialanalysis.ai/models/gpt-6-1-sol-high?ref=t01.li) knapp 58, auf [Xhigh](https://artificialanalysis.ai/models/gpt-6-1-sol-xhigh?ref=t01.li) knapp 109 und auf [Max](https://artificialanalysis.ai/models/gpt-6-1-sol?ref=t01.li) fast 273 Sekunden – die Thinking-Zeit eingerechnet. Das sind Kennwerte aus den Testbedingungen von Artificial Analysis und keine feste Wartezeit für jeden Request. Mit rund 59 bis 66 Tokens pro Sekunde liegt das Modell außerdem unter dem Median vergleichbarer Modelle von knapp 71.

Für einen [Agenten-Loop](https://t01.li/glossar/#agentic-loop), der viele kurze Schritte schnell abarbeiten soll, wäre Max damit für mich kein naheliegender Ausgangspunkt. Gegenüber Xhigh bringt die Stufe einen weiteren gerundeten Indexpunkt, kostet pro Index-Task rund 85 % mehr und steht beim ausgewiesenen Latenzwert bei gut viereinhalb Minuten. Ob sich das für einen konkreten Workflow rechnet, würde ich im eigenen Setup prüfen (und mir vorher einen Kaffee holen).

## Iteration? Nach der Versionsnummer schon

Ich hätte *GPT-6.1 Sol* nach Versionsnummer und Preisliste erstmal als Iteration einsortiert und bei Preis und Kontextfenster trägt das auch, im Index aber nicht. OpenAI selbst spricht im DevDay-Rückblick von einem großen Upgrade – eine Selbstbeschreibung, die ich im Normalfall unter Marketing wegsortiert hätte. Aber: hier stützen die unabhängigen Zahlen jene Selbstbeschreibung zumindest auf den unteren und mittleren Stufen.

Hotter Take: Versionsnummern sagen bei OpenAI gerade wenig darüber, wie groß ein Schritt tatsächlich ist. Letzte Woche kam eine neue Generation mit einem Punkt Plus, diese Woche eine Nachkommastelle mit acht.

Wer *GPT-6 Sol* produktiv einsetzt, sollte vor dem Wechsel alle Requests suchen, die `reasoning.effort` auf `none` setzen. Bei Chat Completions heißt der Parameter `reasoning_effort`, also am besten nach beidem greppen, und gleich mit nach Tool-Aufrufen über Chat Completions. Danach würde ich Medium und High im eigenen [Harness](https://t01.li/glossar/#harness) gegen den bisherigen Stand laufen lassen, bevor ich mich auf die [Evals](https://t01.li/glossar/#eval) des Herstellers verlasse.

Eigentlich wollte ich *GPT-6.1 Sol* heute schon in *Codex* mit ganz klassischem Kram testen – so einem frischen *Astro*\-Stack ohne Altlasten. Dazu bin ich nicht gekommen, dann eben morgen.

Bis dahin lasse ich das so stehen, mit der Erkenntnis, dass eine .1 manchmal mehr bewegt als eine 6.