KI News 7 Min. Lesezeit

Claude Sonnet 5.5: Opus-nahe Benchmarks zum Sonnet-Preis – solange du beim Effort nicht übertreibst

Claude Sonnet 5.5 kostet so viel wie Sonnet 5 und liegt in Benchmarks nah an Opus 5.5. Artificial Analysis setzt ein Sternchen dran, und der Developer-Guide zeigt, wofür Anthropic das Modell wirklich sieht: als Arbeitspferd für wiederkehrende Agenten-Tasks.

Laptop zeigt Anthropic-Logo und Claude Sonnet 5.5 auf dem Display vor stimmungsvollem Bokeh-Hintergrund.

Anthropic hat am 28. September Claude Sonnet 5.5 veröffentlicht, sechs Tage nach Opus 5.5 und damit als zweites Modell der 5.5-Familie. Ich bin heute Morgen auf X darüber gestolpert und konnte aus zeitlichen Gründen noch nichts selbst testen und ausprobieren. Das hier ist also eine Einordnung der Papierlage, kein Praxistest.

Die Eckdaten aus dem Launch-Post von Anthropic lesen sich wie ein Wunschzettel: gleicher Preis pro Token wie Sonnet 5, über 30 % schneller und pro Task bis zu 30 % günstiger, weil das Modell für dieselbe Arbeit weniger Tokens braucht. Am selben Tag erschien im Developer-Blog der Guide „Building with Claude Sonnet 5.5“ von Addy Osmani. So ein Playbook direkt zum Launch gehört bei den 5.5-Releases offenbar zum Paket, denn auch Opus 5.5 bekam vergangene Woche am Launch-Tag einen eigenen Guide, ebenfalls von Osmani. Über weite Strecken liest sich der Guide wie eine Betriebsanleitung für Agenten.

TL;DR

Anthropics neues Mittelklasse-Modell rückt in Benchmarks nah an Opus 5.5 heran, der Kostenvorteil pro Task hängt aber am Effort-Level.

  • Preis pro Token unverändert: 2 $ Input und 10 $ Output pro Million Tokens, halb so viel wie bei Opus 5.5.
  • Artificial Analysis misst 56 Punkte im Intelligence Index, zwei hinter Opus 5.5 – auf Max-Effort allerdings mit dem höchsten je gemessenen Tokenverbrauch.
  • Für agentische Workflows gibt es Breaking Changes, unter anderem between_tools statt abgeschaltetem Thinking.
  • Anthropic sieht Sonnet 5.5 bei klar abgegrenzten, wiederkehrenden Agenten-Tasks, Opus 5.5 bei der langen Strecke.

Was Claude Sonnet 5.5 kann und was es kostet

Am Preis pro Token hat Anthropic nicht gedreht. Input kostet 2 $ pro Million Tokens, Output 10 $, Cache-Reads 0,20 $. Opus 5.5 kostet mit 4 $ und 20 $ genau das Doppelte, nur beim Cache-Read liegen beide gleichauf. Das Kontextfenster fasst nativ eine Million Tokens ohne Beta-Header, der reguläre Output ist auf 128.000 Tokens begrenzt (über die Message Batches API per Beta-Header bis zu 300.000), und der Knowledge Cutoff liegt im Juni 2026. Erreichbar ist das Modell über die Claude API als claude-sonnet-5-5 sowie über Amazon Bedrock, Google Cloud und Microsoft Foundry.

Anthropic positioniert Sonnet 5.5 als schnellere, günstigere Ergänzung zu Opus 5.5. Gemeint sind klar abgegrenzte Alltagsaufgaben, Bugfixes, Dokumente, Slides und Spreadsheets also Tabellen, dazu angeblich ein gutes Auge für Design. (Nebenbei ist es der erste Sonnet, der Pokémon Red allein anhand von Screenshots durchgespielt hat – der Benchmark, auf den wir alle gewartet haben.) Haiku 5.5 folgt in den kommenden Wochen.

Wer rechnet, sollte beim Reasoning Effort sehr genau hinschauen: Sonnet 5.5 denkt standardmäßig mit, und die Voreinstellung hängt von der Oberfläche ab – in Claude Code und den Claude-Apps läuft das Modell auf Medium, über die API dagegen auf High. Erfahrungswerte aus beiden Welten hinken da im direkten Vergleich.

Hersteller-Sternchen am Terminal

Die Benchmark-Tabelle im Launch-Post veröffentlicht Anthropic selbst. GDPval-AA und AA-Briefcase hat dabei Artificial Analysis gemessen, allerdings auf einem Pre-Release-Deployment, das laut Anthropic einen inzwischen behobenen Bug bei Structured Outputs hatte. Mit dieser Brille auf der Nase:

  • Terminal-Bench 4.0 (agentisches Coding auf der Kommandozeile): 70,6 %, Sonnet 5 kam auf 10,3 %, Opus 5.5 auf 66,4 %
  • CursorBench 4.0: 55,5 %, knapp hinter Opus 5.5 mit 57,8 %
  • GDPval-AA (Wissensarbeit aus 44 Berufen): 1.844 Punkte, Opus 5.5 liegt bei 1.846
  • OSWorld 2.1 (Computer Use): 80,1 %, Opus 5.5 erreicht 81,8 %

Der Sprung von rund 10 auf gut 70 % bei Terminal-Bench wirkt auf den ersten Blick wie ein Tippfehler, wird aber von Artificial Analysis grob gestützt, die ein Plus von rund 50 Punkten messen. Sonnet 5 war auf diesem Benchmark schlicht schwach.

Fair ist, dass Anthropic die eigene Tabelle selbst relativiert, denn in internen und externen Tests bleibe Opus 5.5 bei komplexer, offener Arbeit, die anhaltendes Urteilsvermögen verlangt, klar stärker. Gleichstand auf dem Papier ist eben kein Gleichstand im Alltag – warum Benchmark-Vergleiche zwischen LLMs wackeln, habe ich an anderer Stelle ausführlicher aufgeschrieben.

Artificial Analysis: 56 Punkte mit Rekordverbrauch

Unabhängige Zahlen liefert wie gewohnt Artificial Analysis. Im Intelligence Index erreicht Sonnet 5.5 auf Max-Effort 56 Punkte, zwei hinter Opus 5.5 (Max) und 18 vor Sonnet 5. Im Launch-Artikel von Artificial Analysis reichte das für Platz zwei, bei so knappen Abständen ist der Rang aber eher eine Momentaufnahme. Auf Terminal-Bench 4.0 messen die Tester 64 %, also spürbar weniger als die 70,6 % aus Anthropics eigener Tabelle. Beim Tempo stützt Artificial Analysis dagegen die Herstellerangabe. Je nach Effort liegen zwischen 89 und 142 Tokens pro Sekunde an, Sonnet 5 kam auf Max auf rund 79.

Der Preis dafür steht, wie üblich, eine Zeile tiefer: Bei Max-Effort verbraucht Sonnet 5.5 rund 193.000 Output-Tokens pro Index-Task, laut Artificial Analysis der höchste Wert, den sie je gemessen haben. Das sind etwa 60 % mehr als bei Opus 5.5 oder Sonnet 5 auf Max und ungefähr siebenmal so viel wie bei GPT-6 Astra. Die Kosten pro Index-Task – ein gewichteter Durchschnitt über die Eval-Aufgaben, kein allgemeiner API-Preis – klettern damit auf 7,60 $ und liegen rund 50 % über Sonnet 5.

Die „bis zu 30 % günstiger“ aus dem Launch-Post und dieser Aufpreis widersprechen sich nicht. Anthropic rechnet mit eigenen Tests, Artificial Analysis mit dem gewichteten Durchschnitt seiner Index-Aufgaben, und beide Zahlen stammen von unterschiedlichen Effort-Stufen. Gerade auf Max kippt die Rechnung bei Artificial Analysis deutlich. Weiter unten sieht das Bild freundlicher aus: Low kommt auf 36 Punkte bei 0,41 $ pro Task, Medium auf 41 Punkte bei 0,59 $, High auf 47 Punkte bei 1,08 $ und Xhigh auf 52 Punkte bei 2,74 $. Der letzte Schritt von Xhigh auf Max kostet dann noch einmal fast das Dreifache. Gerade High hält Artificial Analysis für die wettbewerbsfähigste Stufe, knapp hinter GPT-6 Sol bei praktisch gleichen Kosten pro Task.

Für agentische Setups lohnt noch ein Blick auf die einzelnen Modellseiten. Über den gesamten Index erzeugt Sonnet 5.5 auf Medium 29 Millionen Output-Tokens, auf High 50, auf Xhigh 100 und auf Max 410 Millionen, während der Median vergleichbarer Modelle bei 88 Millionen liegt. Bei der Latenz wird der Abstand noch größer. Bis zum ersten Antwort-Token vergeht auf Medium gut eine Sekunde, auf High sind es knapp 19, auf Xhigh rund 88 Sekunden und auf Max knapp sechs Minuten, weil das Thinking mitzählt. Wer einen Agenten-Loop mit vielen kurzen Schritten baut, wartet so bei jedem Aufruf.

Den Token-Haken, den schon Sonnet 5 mitbrachte, hat Anthropic nicht abgeschafft, er ist nur deutlich nach oben gewandert. Sichtbar wird er ab Xhigh, so richtig teuer bei Max.

Sonnet 5.5 oder Opus 5.5? Der Guide sortiert vor

Die aufschlussreichere Tabelle steht im Developer-Guide. Dort ordnet Anthropic Workloads den beiden Modellen zu. Sonnet 5.5 bekommt klar abgegrenztes Coding, Entwicklung in hohem Volumen und – das ist für mich der interessante Punkt – wohldefinierte Agenten-Tasks, die man immer wieder laufen lässt, etwa Recherche, Review oder Drafting. Opus 5.5 bleibt zuständig für komplexe Arbeit mit Urteilsvermögen, inklusive agentischem Coding über lange Strecken. Der Prompting-Guide bringt es auf einen Satz: „for the hardest long-horizon work, an Opus model is the better choice“.

Dazu passt, was die (von Anthropic kuratierten) Kundenstimmen hervorheben. Base44 berichtet, Sonnet 5.5 habe über 118 App-Builds im Schnitt 3,6 Iterationen gebraucht, Opus 5 dagegen 7,7. Lovable spricht von einem Drittel weniger Tool-Calls, CodeRabbit davon, dass der hohe Tokenverbrauch von Sonnet 5 verschwunden sei. Das sind Launch-Testimonials, keine Studien. Sie zeigen aber, worauf Anthropic optimiert hat: weniger Schritte pro Loop, gebündelte Tool-Calls, weniger Rückfragen an den Menschen.

In Claude Code wird die Rollenverteilung ganz praktisch. Ab Version 2.1.284 verweist der Alias sonnet auf Sonnet 5.5, standardmäßig mit Medium-Effort und nativem 1-Million-Kontext. Das Default-Modell bleibt aber Opus 5.5, wer Sonnet will, wechselt per /model sonnet. Thinking lässt sich in Claude Code für Sonnet 5.5 nicht abschalten. Einen Fast-Mode gibt es auch nicht.

Agentisch heißt erst mal: Migrationsarbeit

Wer Sonnet 5 in eigenen Pipelines oder Agenten betreibt, kann nicht einfach die Model-ID tauschen. Der Guide nennt fünf Breaking Changes und eine geänderte Antwortstruktur, die Migrationsanleitung geht jeden Punkt einzeln durch. Die wichtigsten für agentische Setups:

  • thinking: {"type": "disabled"} quittiert die API mit einem 400er. Ersatz ist das neue between_tools, bei dem das Modell nur zwischen Tool-Calls denkt – allerdings nur bis Effort High.
  • Erzwungenes tool_choice vom Typ any oder tool wirft ebenfalls einen 400er. Stattdessen auto setzen und das Tool mit strict: true markieren.
  • Computer Use läuft über die Claude API und Google Cloud nur noch über computer_toolset_20260801, Amazon Bedrock akzeptiert das alte Tool weiterhin.
  • Thinking-Blöcke sind an Modell und Konversation gebunden, Konversationen sollten also append-only bleiben.
  • Im Advisor-Setup akzeptiert Sonnet 5.5 als Executor weder Opus 4.8 noch Opus 4.7 oder Sonnet 5 als Berater.

Dazu kommen neu kalibrierte Effort-Stufen. Ein altes Setting überträgt sich nicht eins zu eins, deshalb empfiehlt Anthropic, den Effort-Sweep neu zu fahren und für agentisches Coding mit gut spezifizierten Tasks bei Medium anzufangen. Workarounds aus Sonnet 5-Prompts wie das beliebte „do not be lazy“ sollen raus (eine Zeile, die in so manchem Systemprompt vermutlich seit Monaten vor sich hin fossiliert). Auf Low überspringt das Modell laut Guide manchmal den echten Test einer Änderung, bevor es sie als erledigt meldet. Anthropic liefert dafür gleich einen passenden Systemprompt-Absatz mit.

Auch die Fehlerbehandlung im Loop ändert sich. Abgelehnte Requests kommen mit HTTP 200 und stop_reason: "refusal" zurück, für Cyber- und Frontier-LLM-Anfragen kann ein serverseitiger Fallback (Beta) auf Sonnet 5 greifen. Artificial Analysis hat solche Fallbacks in rund 0,1 % der Tasks beobachtet, fast ausschließlich auf Terminal-Bench. Wer auf den Token-Verbrauch in Claude Code achtet, freut sich über die gesunkene Mindestgröße fürs Prompt-Caching von 1.024 auf 512 Tokens.

Arbeitspferd statt kleiner Bruder

Meine Vermutung war, dass der schnell erschienene Guide von Osmani zeigt, wie wichtig Sonnet für agentische Workloads und Entwicklung bei Anthropic ist. Damit lag ich zumindest halb richtig. Am Timing lässt sich das nicht festmachen, weil auch Opus 5.5 am Launch-Tag einen eigenen Guide bekam, am Inhalt aber schon. Zwischen between_tools, gebündelten Tool-Calls und der Workload-Tabelle, die wiederkehrende Agenten-Tasks ausdrücklich zu Sonnet schiebt, wird deutlich, wo Anthropic das Modell sieht – nicht als kleinen Bruder von Opus, sondern als das Modell, das in wiederkehrenden Agenten-Loops täglich durchläuft, während Opus 5.5 die langen, offenen Aufgaben übernimmt.

Heißt für mich: Die Musik spielt bei Medium und High. Max ist eher die Einstellung für Benchmark-Tabellen, es sei denn, die eigenen Evals rechtfertigen den Aufpreis (und man möchte die Kreditkarte mal so richtig zum Glühen bringen). Die gehören vor dem Umstieg ohnehin auf den Plan, zusammen mit einem neuen Effort-Sweep auf den frisch kalibrierten Stufen, statt der Launch-Tabelle einfach zu glauben.

Der erste, ernsthafte Test wird ein agentischer Workflow sein, vermutlich mit Fable oder Opus als Orchestrator und einer Handvoll Sonnet 5.5 Subagents.

Bis dahin lasse ich die Papierlage so für mich stehen, mit einem dicken Sternchen oben auf der Effort-Skala.

Artikel teilen: