Claude Opus 5.5: Fable-Niveau für 40 % weniger, sagt Anthropic
Anthropic bringt Claude Opus 5.5 als Fable-5.1-Niveau für 40 % weniger Betriebskosten. Artificial Analysis sieht das Modell im Intelligence Index vorn und misst auf Medium fast exakt diese Ersparnis gegenüber Opus 5. Preise, Benchmarks, Safeguards und was ich als Nächstes damit teste.
Ich hatte heute die Claude-App gerade geöffnet, da sprang mir das neue Modell förmlich entgegen, noch bevor ich irgendetwas getippt hatte. Claude Opus 5.5 ist seit dem 22. September 2026 verfügbar, als erstes Modell der neuen 5.5-Familie. Sonnet 5.5 und Haiku 5.5 sollen laut Anthropic in den kommenden Wochen folgen.
Die Kernbotschaft aus dem Announcement passt in einen Satz: Opus 5.5 leiste bei den meisten Aufgaben auf dem Niveau von Claude Fable 5.1 und koste im Betrieb 40 % weniger als Opus 5. Das ist eine Hersteller-Aussage, und wir schauen gleich, was Artificial Analysis unabhängig dazu gemessen hat, vorher aber die Fakten.
TL;DR
Claude Opus 5.5 ist Anthropics Effizienz-Release: Fable-Klasse für weniger Geld als Opus 5.
- 4 $/20 $ pro Million Input-/Output-Token, 20 % unter Opus 5; Cache Reads fallen um 60 % auf $0,20.
- Artificial Analysis misst 58 Punkte im Intelligence Index, fünf vor Fable 5.1 und GPT-6 Astra, und kommt Medium gegen Medium auf 39 % weniger Kosten pro Aufgabe als Opus 5.
- Safeguards derselben Klasse wie bei Fable 5.1, Cyber-Aufgaben landen bei Opus 4.8, Thinking lässt sich nicht mehr abschalten.
Claude Opus 5.5 in Zahlen
| Eckdaten | Claude Opus 5.5 |
|---|---|
| Release | 22. September 2026, erstes Modell der Claude-5.5-Familie |
| Kontextfenster | 1M Token, Input Text und Bild |
| Effort-Stufen | low, medium (Default), high, xhigh, max; Thinking nicht abschaltbar |
| Preis | 4 $/ 20 $ pro Million Input-/Output-Token, Cache Reads 0,20 $ |
| Fast Mode | bis 2,5-fache Geschwindigkeit, 8 $ / 40 $, in Claude Code und auf der Platform |
| AA Intelligence Index | 58 auf Max, 51 auf Medium (Fable 5.1: 53, GPT-6 Astra: 53, Opus 5: 51) |
| Safeguards | Cyber und Biologie in der Fable-5.1-Klasse, Cyber-Fallback auf Opus 4.8 |
| Verfügbarkeit | Claude Platform, AWS, Google Cloud, Microsoft Azure |
Preis, Tempo und Limits bei Claude Opus 5.5
Die Preisliste ist mal der handfeste Teil der Meldung: Input-Token kosten 4 $ pro Million, Output-Token 20 $, jeweils 20 % unter Opus 5 mit seinen 5$ /25 $. Cache Reads gehen von 0,50 $ auf 0,20 $ runter, ein Minus von 60 %. Laut Anthropic machen sie bei agentischer Arbeit und beim Coden den Großteil der Kosten aus, und wer lange Tool-Loops laufen lässt, weiß, dass genau dort die Musik spielt. Cache Writes sinken von 6,25 $ auf 5 $.
| Preis pro 1M Token | Opus 5.5 | Opus 5 | Differenz |
|---|---|---|---|
| Cache Reads | 0,20 $ | 0,50 $ | −60 % |
| Input | 4 $ | 5 $ | −20 % |
| Output | 20 $ | 25 $ | −20 % |
| Cache Writes | 5 $ | 6,25 $ | −20 % |
| Kosten pro AA-Index-Aufgabe (Medium) | 1,34 $ | 2,19 $ | −39 % |
Die 40 % Ersparnis, die Anthropic ausruft, setzen sich aus zwei Teilen zusammen. Der Token-Preis fällt, und das Modell soll mit Default-Einstellungen weniger Token pro Aufgabe verbrauchen als Opus 5. Ersteres kann man in der Preisliste nachlesen, Letzteres ist eine Messung aus dem Haus Anthropic „on typical workloads“, was auch immer „typical“ heißen mag. Dazu kommt ein Tempo-Versprechen von über 30 % schnellerem Output – aber das lässt sich immerhin nachmessen. Artificial Analysis kommt auf Medium-Effort auf 76 Token pro Sekunde, Opus 5 auf derselben Stufe auf 57. Auf den ersten Antwort-Token wartet man allerdings, weil das Thinking mitzählt, auf Medium 22 Sekunden und auf Xhigh fast drei Minuten. Ein Fast Mode mit bis zu 2,5-facher Geschwindigkeit ist zusätzlich in Claude Code und auf der Platform buchbar, allerdings für saftige 8 $/40 $.
Für Pro, Max, Team und die sitzbasierten Enterprise-Pläne erhöht Anthropic gleichzeitig die 5-Stunden-Limits. Neu ist ein Rate-Limit-Reset, den man aufsparen und bei Bedarf auslösen kann. Klingt nach Kleinkram, ist im Claude-Code-Alltag aber genau das Feature, das man um 17 Uhr vermisst hat.
Benchmarks: Anthropics Tabelle und die Messung von Artificial Analysis
Anthropics eigene Tabelle sieht Opus 5.5 vorn, mit 66,4 % auf Terminal-Bench 4.0 (Fable 5.1: 55,8 %, Opus 5: 52,3 %, GPT-6 Astra: 57,9 %), 54,4 % auf FrontierCode v1.1 und 1.846 Elo auf GDPval-AA v2.1. Die Fußnoten muss man aber sich noch mal anschauen. Der Terminal-Bench-Wert stammt aus der xhigh-Stufe des Reasoning Efforts, die GPT-Zahlen hat OpenAI selbst gemeldet, und die Standardabweichung liegt bei ±2,6 Punkten. Ungewöhnlich offen ist ein Satz im Announcement: Benchmark-Abstände seien auf diesem Niveau kein verlässlicher Indikator mehr für Unterschiede in der Praxis, und intern sei die Lücke zu Fable 5.1 kleiner, als die Tabelle vermuten lässt.
Unabhängig gemessen hat Artificial Analysis noch am Release-Tag. Im Intelligence Index v4.3.2 landet Opus 5.5 auf Max-Effort mit Fallback bei 58 Punkten, Fable 5.1 und GPT-6 Astra teilen sich Platz zwei mit 53, Opus 5 kommt auf 51. Die Effort-Leiter darunter liest sich 56, 54, 51 und 42 für xhigh, high, medium und low. Schon High liegt damit knapp über Fable 5.1 auf Max, im ungerundeten Index trennen die beiden 0,2 Punkte. Sechs der zehn Teil-Evaluationen gehen laut AA auf X an das neue Modell, darunter Humanity's Last Exam mit 61,4 % (bisheriger Bestwert: 59,1 % von Fable 5.1) und SciCode mit 66,9 %. Auf Terminal-Bench 4.0 sieht Artificial Analysis Opus 5.5 gleichauf mit GPT-6 Astra, also enger beieinander als in Anthropics Tabelle. Die Setups unterscheiden sich bei Harness und Effort-Stufe, die Werte lassen sich deshalb nicht eins zu eins gegeneinanderhalten. Erwähnenswert ist außerdem der AA-Omniscience Index, der falsche Antworten bestraft und Nichtwissen nicht. Dort liegt Opus 5.5 auf Max bei 46 Punkten, Fable 5.1 bei 43 und Opus 5 bei 37. Das spricht in diesem Setup für eine bessere Kombination aus Wissen und Kalibrierung, eine direkte Messung der Halluzinationsrate ist der Index allerdings nicht.
Interessanter als der Spitzenwert ist die Kostenspalte. Artificial Analysis rechnet einen gewichteten Durchschnittspreis pro Index-Aufgabe aus, und der reicht bei Opus 5.5 von 0,55 $ auf Low bis 5,98 $ auf Max, gut das Elffache. Der Sweet Spot liegt bei Medium. Dort gibt es 51 Punkte für 1,34 $ pro Aufgabe, also dasselbe Ergebnis, das Opus 5 nur auf seiner Max-Stufe erreicht hat. Gegen Opus 5 auf Medium mit $2,19 sind das 39 % weniger. Damit landet Artificial Analysis in diesem Medium-gegen-Medium-Setup fast exakt bei Anthropics 40-%-Versprechen, das sich laut Announcement auf den Default-Effort bezieht, und Default heißt bei Opus 5.5 Medium. Mehr lässt sich daraus allerdings nicht ableiten, Anthropic spricht von „typical workloads“, Artificial Analysis misst seinen eigenen Index. Wer auf Max dreht, zahlt für sieben Punkte mehr den viereinhalbfachen Preis. Dahinter steckt der Token-Verbrauch, denn für den kompletten Index-Durchlauf hat Opus 5.5 auf Medium 38 Millionen Output-Token erzeugt, auf Max 260 Millionen.
Safeguards, Thinking-Zwang und Kleingedrucktes
Opus 5.5 ist das erste Opus-Modell mit Safeguards derselben Klasse wie Fable 5.1. Cybersecurity-Aufgaben jenseits des normalen Bugfixings leitet Anthropic laut Announcement transparent auf Opus 4.8 um, für Biologie-Themen greifen dieselben Safeguards wie bei Fable 5.1, ebenfalls mit Fallback auf ein anderes Modell, es sei denn, man ist über das Life Sciences Verification Program freigeschaltet. Wie sich das anfühlt, hatte ich beim Fable-5.1-Release schon beschrieben. Anthropic weist übrigens selbst darauf hin, dass die eigenen Benchmarks mit aktiven Safeguards gelaufen sind, was die Werte nach eigener Einschätzung eher drückt als hebt.
Drei weitere Punkte gehören in jeden Integrations-Check. Thinking lässt sich nicht mehr abschalten, Opus 5.5 gibt es nur noch als Reasoning-Modell. Preserved Thinking, der Anti-Distillation-Mechanismus aus Fable 5.1, gilt laut Announcement auch für Opus 5.5 bei API-Accounts, die ab dem 31. August 2026 angelegt wurden, und soll verhindern, dass sich über nachträglich editierten Kontext das Reasoning des Modells abgreifen lässt. Und das Text-Watermarking für den EU AI Act ist wie bei Fable 5.1 an Bord. Zero Data Retention bleibt laut Anthropic wie bei den bisherigen Opus-Modellen verfügbar.
Einordnung
Was mich an dieser Meldung mehr anspricht als die Benchmark-Tabelle, ist der Preis. 0,20 $ pro Million Cache-Reads bei einem Frontier-Modell ist eine Ansage, und die 20 % auf Input und Output sind unabhängig von jeder Effort-Diskussion echt. Ob die 40 % „auf typischen Workloads“ bei mir ankommen, entscheidet sich daran, wie viel Effort ich dem Modell zugestehe, denn zwischen Medium und Max liegt laut Artificial Analysis ein Faktor 4,5 beim Preis pro Aufgabe. Beim Opus-5-Release war die Preis-Rechnung ähnlich aufgebaut.
Der zweite Punkt ist die Alignment-Passage, die offener formuliert ist als üblich. Anthropic schreibt, das Modell vermute häufig, dass es evaluiert wird, und das erschwere die Bewertung, wie es sich im echten Einsatz verhält. Das ist keine PR-Zeile, sondern ein Vermerk, den man bei einem Modell, das laut einem Clio-Entwickler im Launch-Text 18 Stunden unbeaufsichtigt über sechs Repos gearbeitet hat, mal im Hinterkopf behalten sollte (ein bisschen zumindest).
Ich teste das als Nächstes in Claude Code, ich habe nur noch keinen Plan im Moment, wofür genau. Vielleicht erst mal etwas Kleines, Schickes mit Astro und ein paar Modulen darin.