> ## Content Index
> Fetch the complete content index at: https://t01.li/llms.txt
> Use this file to discover other available public pages before exploring further.

# Claude Sonnet 5.5: Opus-nahe Benchmarks zum Sonnet-Preis – solange du beim Effort nicht übertreibst
- URL: https://t01.li/ki-news/claude-sonnet-5-5-benchmarks-preis-agenten/
- Published: 2026-09-29T08:04:52.000Z
- Updated: 2026-09-29T08:04:52.000Z
- Description: Claude Sonnet 5.5 kostet so viel wie Sonnet 5 und liegt in Benchmarks nah an Opus 5.5. Artificial Analysis setzt ein Sternchen dran, und der Developer-Guide zeigt, wofür Anthropic das Modell wirklich sieht: als Arbeitspferd für wiederkehrende Agenten-Tasks.
- Author: Tobias Glawe
- Tags: KI News

Anthropic hat am 28\. September *Claude Sonnet 5.5* veröffentlicht, sechs Tage nach [*Opus 5.5*](https://t01.li/ki-news/claude-opus-5-5-fable-niveau-40-prozent-guenstiger/) und damit als zweites Modell der 5.5-Familie. Ich bin heute Morgen auf X darüber gestolpert und konnte aus zeitlichen Gründen noch nichts selbst testen und ausprobieren. Das hier ist also eine Einordnung der Papierlage, kein Praxistest.

Die Eckdaten aus dem [Launch-Post von Anthropic](https://www.anthropic.com/claude-sonnet-5-5?ref=t01.li) lesen sich wie ein Wunschzettel: gleicher Preis pro Token wie *Sonnet 5*, über 30 % schneller und pro Task bis zu 30 % günstiger, weil das Modell für dieselbe Arbeit weniger Tokens braucht. Am selben Tag erschien im Developer-Blog der Guide [„Building with Claude Sonnet 5.5“](https://claude.dev/blog/building-with-claude-sonnet-5-5/?ref=t01.li) von Addy Osmani. So ein Playbook direkt zum Launch gehört bei den 5.5-Releases offenbar zum Paket, denn auch *Opus 5.5* bekam vergangene Woche am Launch-Tag [einen eigenen Guide](https://claude.dev/blog/getting-the-most-out-of-opus-5-5/?ref=t01.li), ebenfalls von Osmani. Über weite Strecken liest sich der Guide wie eine Betriebsanleitung für Agenten.

## TL;DR 

Anthropics neues Mittelklasse-Modell rückt in Benchmarks nah an *Opus 5.5* heran, der Kostenvorteil pro Task hängt aber am Effort-Level.

- Preis pro Token unverändert: 2 $ Input und 10 $ Output pro Million Tokens, halb so viel wie bei *Opus 5.5*.
- Artificial Analysis misst 56 Punkte im Intelligence Index, zwei hinter *Opus 5.5* – auf Max-Effort allerdings mit dem höchsten je gemessenen Tokenverbrauch.
- Für agentische Workflows gibt es Breaking Changes, unter anderem `between_tools` statt abgeschaltetem Thinking.
- Anthropic sieht *Sonnet 5.5* bei klar abgegrenzten, wiederkehrenden Agenten-Tasks, *Opus 5.5* bei der langen Strecke.

## Was Claude Sonnet 5.5 kann und was es kostet

Am Preis pro Token hat Anthropic nicht gedreht. Input kostet 2 $ pro Million Tokens, Output 10 $, Cache-Reads 0,20 $. *Opus 5.5* kostet mit 4 $ und 20 $ genau das Doppelte, nur beim Cache-Read liegen beide gleichauf. Das [Kontextfenster](https://t01.li/glossar/#kontextfenster) fasst nativ eine Million Tokens ohne Beta-Header, der reguläre Output ist auf 128.000 Tokens begrenzt (über die Message Batches API per Beta-Header bis zu 300.000), und der Knowledge Cutoff liegt im Juni 2026\. Erreichbar ist das Modell über die Claude API als `claude-sonnet-5-5` sowie über Amazon Bedrock, Google Cloud und Microsoft Foundry.

Anthropic positioniert *Sonnet 5.5* als schnellere, günstigere Ergänzung zu *Opus 5.5*. Gemeint sind klar abgegrenzte Alltagsaufgaben, Bugfixes, Dokumente, Slides und Spreadsheets also Tabellen, dazu angeblich ein gutes Auge für Design. (Nebenbei ist es der erste Sonnet, der *Pokémon Red* allein anhand von Screenshots durchgespielt hat – der Benchmark, auf den wir alle gewartet haben.) *Haiku 5.5* folgt in den kommenden Wochen.

Wer rechnet, sollte beim [Reasoning Effort](https://t01.li/glossar/#reasoning-effort) sehr genau hinschauen: *Sonnet 5.5* denkt standardmäßig mit, und die Voreinstellung hängt von der Oberfläche ab – in *Claude Code* und den Claude-Apps läuft das Modell auf Medium, über die API dagegen auf High. Erfahrungswerte aus beiden Welten hinken da im direkten Vergleich.

## Hersteller-Sternchen am Terminal

Die Benchmark-Tabelle im Launch-Post veröffentlicht Anthropic selbst. GDPval-AA und AA-Briefcase hat dabei Artificial Analysis gemessen, allerdings auf einem Pre-Release-Deployment, das laut Anthropic einen inzwischen behobenen Bug bei [Structured Outputs](https://t01.li/glossar/#structured-output) hatte. Mit dieser Brille auf der Nase:

- Terminal-Bench 4.0 (agentisches Coding auf der Kommandozeile): 70,6 %, *Sonnet 5* kam auf 10,3 %, *Opus 5.5* auf 66,4 %
- CursorBench 4.0: 55,5 %, knapp hinter *Opus 5.5* mit 57,8 %
- GDPval-AA (Wissensarbeit aus 44 Berufen): 1.844 Punkte, *Opus 5.5* liegt bei 1.846
- OSWorld 2.1 (Computer Use): 80,1 %, *Opus 5.5* erreicht 81,8 %

Der Sprung von rund 10 auf gut 70 % bei Terminal-Bench wirkt auf den ersten Blick wie ein Tippfehler, wird aber von Artificial Analysis grob gestützt, die ein Plus von rund 50 Punkten messen. *Sonnet 5* war auf diesem Benchmark schlicht schwach.

Fair ist, dass Anthropic die eigene Tabelle selbst relativiert, denn in internen und externen Tests bleibe *Opus 5.5* bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen verlangt, klar stärker. Gleichstand auf dem Papier ist eben kein Gleichstand im Alltag – [warum Benchmark-Vergleiche zwischen LLMs wackeln](https://t01.li/ki-systemdesign/wenn-benchmarks-lugen-warum-der-llm-vergleich-kaputt-ist/), habe ich an anderer Stelle ausführlicher aufgeschrieben.

## Artificial Analysis: 56 Punkte mit Rekordverbrauch

Unabhängige Zahlen liefert wie gewohnt [Artificial Analysis](https://artificialanalysis.ai/models/releases/claude-sonnet-5-5?ref=t01.li). Im Intelligence Index erreicht *Sonnet 5.5* auf Max-Effort 56 Punkte, zwei hinter *Opus 5.5* (Max) und 18 vor *Sonnet 5*. Im [Launch-Artikel von Artificial Analysis](https://artificialanalysis.ai/articles/claude-sonnet-5-5?ref=t01.li) reichte das für Platz zwei, bei so knappen Abständen ist der Rang aber eher eine Momentaufnahme. Auf Terminal-Bench 4.0 messen die Tester 64 %, also spürbar weniger als die 70,6 % aus Anthropics eigener Tabelle. Beim Tempo stützt Artificial Analysis dagegen die Herstellerangabe. Je nach Effort liegen zwischen 89 und 142 Tokens pro Sekunde an, [*Sonnet 5* kam auf Max auf rund 79](https://artificialanalysis.ai/models/claude-sonnet-5?ref=t01.li).

Der Preis dafür steht, wie üblich, eine Zeile tiefer: Bei Max-Effort verbraucht *Sonnet 5.5* rund 193.000 Output-Tokens pro Index-Task, laut Artificial Analysis der höchste Wert, den sie je gemessen haben. Das sind etwa 60 % mehr als bei *Opus 5.5* oder *Sonnet 5* auf Max und ungefähr siebenmal so viel wie bei *GPT-6 Astra*. Die Kosten pro Index-Task – ein gewichteter Durchschnitt über die Eval-Aufgaben, kein allgemeiner API-Preis – klettern damit auf 7,60 $ und liegen [rund 50 % über *Sonnet 5*](https://artificialanalysis.ai/articles/claude-sonnet-5-5?ref=t01.li).

Die „bis zu 30 % günstiger“ aus dem Launch-Post und dieser Aufpreis widersprechen sich nicht. Anthropic rechnet mit eigenen Tests, Artificial Analysis mit dem gewichteten Durchschnitt seiner Index-Aufgaben, und beide Zahlen stammen von unterschiedlichen Effort-Stufen. Gerade auf Max kippt die Rechnung bei Artificial Analysis deutlich. Weiter unten sieht das Bild freundlicher aus: Low kommt auf 36 Punkte bei 0,41 $ pro Task, Medium auf 41 Punkte bei 0,59 $, High auf 47 Punkte bei 1,08 $ und Xhigh auf 52 Punkte bei 2,74 $. Der letzte Schritt von Xhigh auf Max kostet dann noch einmal fast das Dreifache. Gerade High hält Artificial Analysis für die wettbewerbsfähigste Stufe, [knapp hinter *GPT-6 Sol* bei praktisch gleichen Kosten pro Task](https://artificialanalysis.ai/articles/claude-sonnet-5-5?ref=t01.li).

Für agentische Setups lohnt noch ein Blick auf [die einzelnen Modellseiten](https://artificialanalysis.ai/models/claude-sonnet-5-5-xhigh?ref=t01.li). Über den gesamten Index erzeugt *Sonnet 5.5* auf Medium 29 Millionen Output-Tokens, auf High 50, auf Xhigh 100 und auf Max 410 Millionen, während der Median vergleichbarer Modelle bei 88 Millionen liegt. Bei der Latenz wird der Abstand noch größer. Bis zum ersten Antwort-Token vergeht auf Medium gut eine Sekunde, auf High sind es knapp 19, auf Xhigh rund 88 Sekunden und auf Max knapp sechs Minuten, weil das Thinking mitzählt. Wer einen Agenten-Loop mit vielen kurzen Schritten baut, wartet so bei jedem Aufruf.

Den [Token-Haken, den schon *Sonnet 5* mitbrachte](https://t01.li/ki-news/claude-sonnet-5-agentisch-naeher-an-opus-mit-token-haken-beim-preis/), hat Anthropic nicht abgeschafft, er ist nur deutlich nach oben gewandert. Sichtbar wird er ab Xhigh, so richtig teuer bei Max.

## Sonnet 5.5 oder Opus 5.5? Der Guide sortiert vor

Die aufschlussreichere Tabelle steht im [Developer-Guide](https://claude.dev/blog/building-with-claude-sonnet-5-5/?ref=t01.li). Dort ordnet Anthropic Workloads den beiden Modellen zu. *Sonnet 5.5* bekommt klar abgegrenztes Coding, Entwicklung in hohem Volumen und – das ist für mich der interessante Punkt – wohldefinierte Agenten-Tasks, die man immer wieder laufen lässt, etwa Recherche, Review oder Drafting. *Opus 5.5* bleibt zuständig für komplexe Arbeit mit Urteilsvermögen, inklusive agentischem Coding über lange Strecken. Der [Prompting-Guide](https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-sonnet-5-5?ref=t01.li) bringt es auf einen Satz: „for the hardest long-horizon work, an Opus model is the better choice“.

Dazu passt, was die (von Anthropic kuratierten) Kundenstimmen hervorheben. Base44 berichtet, *Sonnet 5.5* habe über 118 App-Builds im Schnitt 3,6 Iterationen gebraucht, *Opus 5* dagegen 7,7\. Lovable spricht von einem Drittel weniger Tool-Calls, CodeRabbit davon, dass der hohe Tokenverbrauch von *Sonnet 5* verschwunden sei. Das sind Launch-Testimonials, keine Studien. Sie zeigen aber, worauf Anthropic optimiert hat: weniger Schritte pro Loop, gebündelte [Tool-Calls](https://t01.li/glossar/#tool-calling), weniger Rückfragen an den Menschen.

In *Claude Code* wird die Rollenverteilung ganz praktisch. Ab Version 2.1.284 verweist der Alias `sonnet` auf *Sonnet 5.5*, standardmäßig mit Medium-Effort und nativem 1-Million-Kontext. Das Default-Modell bleibt aber *Opus 5.5*, wer *Sonnet* will, wechselt per `/model sonnet`. Thinking lässt sich in *Claude Code* für *Sonnet 5.5* nicht abschalten. Einen Fast-Mode gibt es auch nicht.

## Agentisch heißt erst mal: Migrationsarbeit

Wer *Sonnet 5* in eigenen Pipelines oder Agenten betreibt, kann nicht einfach die Model-ID tauschen. Der Guide nennt fünf Breaking Changes und eine geänderte Antwortstruktur, die [Migrationsanleitung](https://platform.claude.com/docs/en/models/sonnet-5-5/migration-guide?ref=t01.li) geht jeden Punkt einzeln durch. Die wichtigsten für agentische Setups:

- `thinking: {"type": "disabled"}` quittiert die API mit einem 400er. Ersatz ist das neue `between_tools`, bei dem das Modell nur zwischen Tool-Calls denkt – allerdings nur bis Effort High.
- Erzwungenes `tool_choice` vom Typ `any` oder `tool` wirft ebenfalls einen 400er. Stattdessen `auto` setzen und das Tool mit `strict: true` markieren.
- Computer Use läuft über die Claude API und Google Cloud nur noch über `computer_toolset_20260801`, Amazon Bedrock akzeptiert das alte Tool weiterhin.
- Thinking-Blöcke sind an Modell und Konversation gebunden, Konversationen sollten also append-only bleiben.
- Im Advisor-Setup akzeptiert *Sonnet 5.5* als Executor weder *Opus 4.8* noch *Opus 4.7* oder *Sonnet 5* als Berater.

Dazu kommen neu kalibrierte Effort-Stufen. Ein altes Setting überträgt sich nicht eins zu eins, deshalb empfiehlt Anthropic, den Effort-Sweep neu zu fahren und für agentisches Coding mit gut spezifizierten Tasks bei Medium anzufangen. Workarounds aus *Sonnet 5*\-Prompts wie das beliebte „do not be lazy“ sollen raus (eine Zeile, die in so manchem Systemprompt vermutlich seit Monaten vor sich hin fossiliert). Auf Low überspringt das Modell laut Guide manchmal den echten Test einer Änderung, bevor es sie als erledigt meldet. Anthropic liefert dafür gleich einen passenden Systemprompt-Absatz mit.

Auch die Fehlerbehandlung im Loop ändert sich. Abgelehnte Requests kommen mit HTTP 200 und `stop_reason: "refusal"` zurück, für Cyber- und Frontier-LLM-Anfragen kann ein serverseitiger Fallback (Beta) auf *Sonnet 5* greifen. Artificial Analysis hat solche Fallbacks [in rund 0,1 % der Tasks beobachtet](https://artificialanalysis.ai/articles/claude-sonnet-5-5?ref=t01.li), fast ausschließlich auf Terminal-Bench. Wer auf den [Token-Verbrauch in Claude Code](https://t01.li/ai-dev/token-effizienz-in-claude-code-was-hilft/) achtet, freut sich über die gesunkene Mindestgröße fürs Prompt-Caching von 1.024 auf 512 Tokens.

## Arbeitspferd statt kleiner Bruder

Meine Vermutung war, dass der schnell erschienene Guide von Osmani zeigt, wie wichtig *Sonnet* für agentische Workloads und Entwicklung bei Anthropic ist. Damit lag ich zumindest halb richtig. Am Timing lässt sich das nicht festmachen, weil auch *Opus 5.5* am Launch-Tag einen eigenen Guide bekam, am Inhalt aber schon. Zwischen `between_tools`, gebündelten Tool-Calls und der Workload-Tabelle, die wiederkehrende Agenten-Tasks ausdrücklich zu *Sonnet* schiebt, wird deutlich, wo Anthropic das Modell sieht – nicht als kleinen Bruder von *Opus*, sondern als das Modell, das in [wiederkehrenden Agenten-Loops](https://t01.li/ki-systemdesign/loop-engineering-agenten-prozess/) täglich durchläuft, während *Opus 5.5* die langen, offenen Aufgaben übernimmt.

Heißt für mich: Die Musik spielt bei Medium und High. Max ist eher die Einstellung für Benchmark-Tabellen, es sei denn, die eigenen [Evals](https://t01.li/glossar/#eval) rechtfertigen den Aufpreis (und man möchte die Kreditkarte mal so richtig zum Glühen bringen). Die gehören vor dem Umstieg ohnehin auf den Plan, zusammen mit einem neuen Effort-Sweep auf den frisch kalibrierten Stufen, statt der Launch-Tabelle einfach zu glauben.

Der erste, ernsthafte Test wird ein agentischer Workflow sein, vermutlich mit Fable oder Opus als Orchestrator und einer Handvoll *Sonnet 5.5* Subagents.

Bis dahin lasse ich die Papierlage so für mich stehen, mit einem dicken Sternchen oben auf der Effort-Skala.