Claude Haiku 5.5: ein Zehntel des Tokenpreises, solange der Prompt klein bleibt
Claude Haiku 5.5 kostet über die API bei Prompts bis 100.000 Tokens ein Zehntel des Tokenpreises von Haiku 4.5 und springt bei Artificial Analysis von 17 auf 43 Punkte. Die 43 gelten für Max-Effort, voreingestellt ist Medium. Was das Modell für Tool-Use und Subagents taugt.
Anthropic hat am 7. Oktober Claude Haiku 5.5 veröffentlicht, gut zwei Wochen nach Claude Opus 5.5 und neun Tage nach Claude Sonnet 5.5. Der Vorgänger Haiku 4.5 ist rund ein Jahr alt. In den Benchmarks fällt der Abstand deutlich aus. Auf der Launch-Seite nennt Anthropic das neue Modell „the cheapest, fastest, and most capable small model we’ve ever released“ und senkt den API-Preis pro Token um 90 %, allerdings nur für Prompts bis 100.000 Tokens.
Zum Testen von Haiku 5.5 komme ich erst heute und morgen in das über mehrere einzelene Projekte. In Claude Code mit Fokus auf Tool-Use und in der Claude Desktop App in Projekten mit Threads. Der Stand hier also ist deshalb die Papierlage vom Launch-Tag, ergänzt um die unabhängigen Messungen von Artificial Analysis.
TL;DR
Anthropics kleinstes Modell macht einen großen Sprung. Die Schlagzeilenwerte gelten aber für Max-Effort und für den günstigen Tarif bis 100.000 Tokens.
- API-Preis: 0,10 $ Input und 0,50 $ Output pro Million Tokens bei Prompts bis 100.000 Tokens, darüber das Fünffache. Haiku 4.5 kostete 1 $ und 5 $. Der neue Tokenizer zählt denselben Text mit rund 30 % mehr Tokens.
- 1 Million Tokens Kontext, 128.000 Tokens Output, Effort von Low bis Max mit Medium als Voreinstellung, Adaptive Thinking standardmäßig aktiv.
- Artificial Analysis misst auf Max 43 Punkte (Haiku 4.5: 17), auf Medium 34. Auf Max erzeugt das Modell pro Index-Aufgabe rund dreimal so viele Output-Tokens wie GPT-6 Luna auf Max.
- Gegen Prompt Injections ist Haiku 5.5 im Gray-Swan-Benchmark deutlich robuster als der Vorgänger (Angriffserfolg 7,1 % gegenüber 83,2 %). Harmlose Anfragen lehnt es in Single-Turn-Tests seltener ab als Haiku 4.5, im automatisierten Verhaltensaudit der System Card am häufigsten von allen getesteten Modellen.
- In Claude Code zeigt der Alias
haikuab Version 2.1.293 auf der Anthropic-API auf Haiku 5.5, auf Bedrock, Google Cloud, Foundry und Claude Platform on AWS noch auf Haiku 4.5.
Was Claude Haiku 5.5 kann und was es kostet
Anthropic zielt mit Haiku 5.5 auf Arbeit in großen Mengen, bei der jeder Aufruf aufs Budget geht, also Zusammenfassungen, Compaction, Datenbankabfragen und Klassifizierung, dazu auf Aufgaben, bei denen es auf Tempo ankommt, etwa Kundensupport in Echtzeit und Browser Use. Beim Coding soll das Modell als Subagent neben Opus 5.5 und Sonnet 5.5 mitlaufen. Das schnellste Modell im Haus ist es laut Fußnote nur bei Standardgeschwindigkeit (Opus im Fast Mode zieht vorbei).
Technisch rückt der Kleine in der Familie an die großen Geschwister heran. Das Kontextfenster wächst von 200.000 auf eine Million Tokens, der Output ist auf 128.000 Tokens begrenzt, und das Modell nimmt Text und Bilder entgegen, antwortet aber nur in Text. Der Knowledge Cutoff liegt laut Modellübersicht im Juni 2026.
Neu für die Haiku-Linie ist der Reasoning Effort mit fünf Stufen von Low bis Max, voreingestellt ist Medium. Adaptive Thinking ist standardmäßig aktiv, das Modell entscheidet selbst, ob und wie lange es nachdenkt. Code, der für Haiku 4.5 geschrieben wurde, kann laut Release Notes Fehler werfen, weil ein festes Thinking-Budget per budget_tokens jetzt einen 400-Fehler auslöst und Antworten mit Thinking-Blöcken beginnen können.
Erreichbar ist das Modell über die Claude API als claude-haiku-5-5 sowie über Amazon Bedrock, Claude Platform on AWS, Google Cloud und Microsoft Foundry. Die API-Preise im Überblick, laut Launch-Seite und Modellseite:
| pro 1 Mio. Tokens | Haiku 5.5 bis 100k | Haiku 5.5 über 100k | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| Input | 0,10 $ | 0,50 $ | 1,00 $ | 2,00 $ |
| Output | 0,50 $ | 2,50 $ | 5,00 $ | 10,00 $ |
| Cache-Read | 0,01 $ | 0,05 $ | 0,10 $ | 0,10 $ |
| Cache-Write (5 Min.) | 0,125 $ | 0,625 $ | 1,25 $ | 2,50 $ |
Ein Zehntel des Tokenpreises aber mit kleiner Fußnote
Anthropic beziffert die durchschnittliche Ersparnis gegenüber Haiku 4.5 auf rund 75 %, die 90 % stehen erst in einer Fußnote. Der neue Preis gilt nur für Prompts bis 100.000 Tokens. Darüber kostet Haiku 5.5 das Fünffache und liegt mit 0,50 $ und 2,50 $ immer noch bei der Hälfte von Haiku 4.5, das einen Einheitspreis hatte. In seine Kalkulation bezieht Anthropic ein, dass 90 % der Haiku-4.5-Requests unter der Schwelle lagen, und berücksichtigt den neuen Tokenizer. Laut Migrationsguide zählt derselbe Eingabetext damit ungefähr 30 % mehr Tokens als bei Haiku 4.5, je nach Inhalt. Was eine erledigte Aufgabe am Ende kostet, hängt zusätzlich davon ab, wie lange das Modell nachdenkt.
Für z.B. Klassifizierung mit kurzen Prompts passt die Rechnung dann. In einem Agent-Loop, der den Verlauf weiterreicht, wächst der Prompt ohne Kürzung mit jedem Tool-Ergebnis. Überschreitet ein einzelner Request 100.000 Prompt-Tokens, greift für diesen Request der höhere Tarif. Ob gecachte Tokens dabei mitzählen, regelt Anthropic für Haiku 5.5 nicht ausdrücklich. Die Preisdoku nennt die Prompt-Länge als Kriterium, und die Doku zum Prompt Caching rechnet Cache-Reads und Cache-Writes zum gesamten Input eines Requests. Ich gehe deshalb davon aus, dass gecachte Tokens zur Schwelle zählen, eine ausdrückliche Abrechnungsregel dazu habe ich nicht gefunden. Claude Code lässt Haiku-5.5-Sessions laut Doku zur Modellkonfiguration bis rund 967.000 Tokens laufen, bevor es den Verlauf kompaktiert, ein kleineres Auto-Compact-Fenster lässt sich pro Modell setzen. Das probiere ich im Test als Erstes aus.
Im unteren Tarif landet Haiku 5.5 exakt beim Preis von GPT-6 Luna, das OpenAI vor gut zwei Wochen auf 0,10 $ und 0,50 $ gesenkt hat. Luna wird laut Modellseite von OpenAI erst bei mehr als 272.000 Input-Tokens teurer, dann kosten Input und Cache das Doppelte und Output das 1,5-Fache, jeweils für den ganzen Request.
Hersteller-Sternchen: die Haiku-Werte gelten für Max
Die Benchmark-Tabelle auf der Launch-Seite vergleicht Haiku 5.5 mit Haiku 4.5, GPT-6 Luna und, zur Orientierung, Sonnet 5.5. Die Werte stammen aus unterschiedlichen Quellen. GDPval-AA und AA-Briefcase hat laut System Card Artificial Analysis unabhängig gemessen, die übrigen Zahlen stammen von Anthropic. Die hervorgehobenen Haiku-Werte gelten für Max-Effort, voreingestellt ist Medium.
- Terminal-Bench 4.0 (agentisches Coding im Terminal): 39,2 %, gemittelt über zehn Durchläufe pro Aufgabe, Haiku 4.5 kam auf 0,0 %, Luna auf 16,4 %, Sonnet 5.5 auf 70,6 %
- OSWorld 2.1, Offline-Subset (Computer Use): 72,4 % als Teilpunktewert (Partial Score) gegenüber 15,7 % beim Vorgänger und 48,9 % bei Luna. Vollständig gelöst hat Haiku 5.5 37,1 % der Aufgaben (Strict Pass Rate), Luna 17,1 % und Haiku 4.5 1,7 %
- GDPval-AA v2.1 (Wissensarbeit, gemessen von Artificial Analysis): 1.620 Punkte, Haiku 4.5 kam auf 735, Luna auf 1.437, Sonnet 5.5 auf 1.840
- AA-Briefcase v1.1 (agentische Wissensarbeit, gemessen von Artificial Analysis): 1.578 Punkte, Haiku 4.5 kam auf 614, Luna auf 1.336, Sonnet 5.5 auf 1.824
- Humanity’s Last Exam: 45,9 % ohne und 57,4 % mit Tools (Haiku 4.5: 10,2 und 18,7 %)
- SWE-bench Multilingual: 83,7 % gegenüber 67,4 % bei Haiku 4.5
Die Sprünge sind groß, was auch am niedrigen Startpunkt liegt. Für die komplexen Aufgaben dieser Terminal-Bench-Version war Haiku 4.5 mit 0 % keine brauchbare Wahl. Den Luna-Wert auf OSWorld hat Anthropic selbst über die OpenAI-API gemessen, eine unabhängige Drittmessung ist das nicht. Wie viel der Effort ausmacht, zeigen die beiden Messungen von Artificial Analysis. Auf Medium kommt Haiku 5.5 bei GDPval-AA auf 1.277 Punkte (Max: 1.620) und bei AA-Briefcase auf 1.372 (Max: 1.578), braucht dafür aber nur etwa ein Zehntel beziehungsweise weniger als ein Viertel der Output-Tokens. Warum solche Benchmark-Vergleiche zwischen LLMs oft weniger hergeben, als die Tabelle verspricht, habe ich an anderer Stelle aufgeschrieben.
Artificial Analysis: 43 Punkte auf Max, 34 auf Medium
Artificial Analysis misst – mann kennt das – unabhängig nach und kommt im Intelligence Index v4.3.2 für Haiku 5.5 auf Max zu 43 Punkten, 26 mehr als bei Haiku 4.5. Damit liegt das Modell laut Auswertung von Artificial Analysis knapp vor GLM-5.3 Flash (42) und Gemini 3.8 Flash (41), klar vor GPT-6 Luna (38) und in Reichweite von Kimi K3 (44), einem Open-Weights-Modell mit 2,8 Billionen Parametern. Sonnet 5.5 auf Max steht 13 Punkte höher.
Auf der Release-Seite stehen alle fünf Effort-Stufen nebeneinander, und die Treppe ist steil. Low kommt auf 29 Punkte, Medium auf 34, High auf 38, Xhigh auf 41 und Max auf 43. Im Default fehlen neun Punkte zur Schlagzeile. Bezahlt wird der Rest in Tokens: Auf Max erzeugt Haiku 5.5 rund 162.000 Output-Tokens pro Index-Aufgabe (gewichteter Durchschnitt, Reasoning eingerechnet). Das sind mal eben fast dreimal so viele wie Luna auf Max. Der Schritt von Xhigh auf Max bringt zwei Punkte für das 1,8-Fache an Tokens. Auf High erreicht Haiku mit rund 55.000 Tokens pro Aufgabe dieselben 38 Punkte wie Luna auf Max mit rund 50.000, und auf den niedrigeren Stufen wächst der Abstand beim Tokenverbrauch laut Artificial Analysis noch.
Mit 244 Tokens pro Sekunde in der Ausgabephase landet Haiku 5.5 auf Max bei Artificial Analysis auf Platz 9 von 182 vergleichbaren Modellen. Bis zum ersten Antwort-Token vergehen auf Low trotzdem knapp 13 Sekunden und auf Max über fünf Minuten, weil das Thinking mitzählt. Für kurze Support-Dialoge spricht diese Messung gegen Max als Voreinstellung. Ob Low oder Medium schnell genug reagieren, wird ein Test mit echten Support-Prompts zeigen.
Auf Terminal-Bench 4.0 liegt die Messung bei 33 % und damit gleichauf mit GLM-5.3 Flash und vor Gemini 3.8 Flash (20 %) und Luna (13 %). Bei AA-Omniscience beantwortet Haiku 5.5 nur 36 % der Wissensfragen richtig, Gemini 3.8 Flash schafft 55 %, Luna 44 %. Dafür gibt das Modell öfter zu, etwas nicht zu wissen. Bei der Rate an Halluzinationen kommt Haiku 5.5 auf 40 %, Gemini 3.8 Flash auf 55 % und Luna auf 77 %. AA-Omniscience zählt dafür laut Methodik die falschen Antworten unter allen nicht korrekt beantworteten Fragen, wozu auch teilweise richtige und ausgelassene gehören. Mit einer Fehlerquote über alle Antworten ist der Wert deshalb nicht zu verwechseln.
Einen Ausreißer nach unten erklärt Artificial Analysis gleich mit: Auf AutomationBench-AA, einem Test für agentische SaaS-Workflows, erreicht Haiku 5.5 nur 35 %, die drei Konkurrenten liegen zwischen 53 und 60 %. Artificial Analysis vermutet, dass der Wert zu niedrig ausfällt, weil ein Problem mit Sicherheitsverweigerungen im Pre-Release-Test zu viele Ablehnungen ausgelöst hat. Anthropic arbeitet an einem Fix, danach will Artificial Analysis neu messen. Auch die Kosten pro Index-Aufgabe (vorläufig 0,21 $ auf Max) bilden den Stufentarif über 100.000 Tokens noch nicht ab.
Tool-Use und Subagents: der eigentliche Job
Wofür Anthropic das Modell sieht, steht auf der Launch-Seite in einem Satz:
„Haiku 5.5 is best suited to more narrowly scoped tasks that might otherwise have been cost-prohibitive with previous versions of Claude – like compaction, summarization, or subagent work.“
Für komplexes agentisches Coding empfiehlt Anthropic im selben Absatz weiterhin Sonnet 5.5 und Opus 5.5. Ein großes Modell plant und entscheidet, Haiku holt Daten, fasst zusammen und erledigt die kleinen Schritte. Der Finanz-KI-Anbieter Rogo beschreibt das in einem der (von Anthropic ausgewählten) Kundenzitate so, dass ein größeres Modell die Präsentation baut, während ein Haiku-Subagent die passende Umsatzzeile aus dem Geschäftsbericht holt.
In Claude Code ist das ab Version 2.1.293 ohne Umweg nutzbar. Der Alias haiku zeigt auf der Anthropic-API auf Haiku 5.5, auf Amazon Bedrock, Google Cloud, Microsoft Foundry und Claude Platform on AWS noch auf Haiku 4.5. Nach dieser Logik landen Subagents, die per model: haiku definiert sind, auf der Anthropic-API beim neuen Modell. Thinking lässt sich bei Haiku 5.5 in Claude Code nicht abschalten, gesteuert wird nur über den Effort. Ein paar Hebel gegen ausufernden Verbrauch habe ich bei der Token-Effizienz in Claude Code gesammelt.
Für Tool-Use ist ein Kapitel der System Card relevant, das im Launch-Post fehlt. Gegen indirekte Prompt Injections, also untergeschobene Anweisungen in Webseiten, Dateien oder Tool-Ergebnissen, ist Haiku 5.5 robuster als der Vorgänger. Im Gray-Swan-Benchmark sinkt die Erfolgsquote eines Angreifers nach 15 Versuchen von 83,2 auf 7,1 %. Beim Coding liegt sie bei 0,2 %, bei Tool Calling bei 4,0 %, die größte Lücke ist Computer Use über die grafische Oberfläche mit 24,4 %. Sonnet 5.5 (3,4 %) und Opus 5.5 (1,0 %) sind insgesamt robuster. Getestet wurde mit Extended Thinking und ohne die zusätzlichen Schutzmaßnahmen gegen Prompt Injections, die Anthropic in seinen Produkten einsetzt. Wie oft ein Angriff auf eine konkrete Anwendung durchkommt, lässt sich aus dem Benchmark nicht ablesen.
Bei den Verweigerungen ist das Bild dann gemischt. In Single-Turn-Tests mit harmlosen, aber heiklen Anfragen lehnt Haiku 5.5 seltener ab als Haiku 4.5 (über die API 0,17 % gegenüber 0,44 %). Sonnet 5.5 und Opus 5.5 lehnen dort noch seltener ab. Im automatisierten Verhaltensaudit hat Haiku 5.5 harmlose Anfragen dagegen häufiger verweigert als jedes andere getestete Modell. Der AutomationBench-Ausreißer passt zu dieser Beobachtung, eine gemeinsame Ursache belegt die System Card nicht. Für meinen Test heißt das, Verweigerungen von Anfang an mitzuloggen und genau hinzusehen, ob Medium für saubere Tool-Calls reicht und wie schnell einzelne Requests über die 100.000 Tokens wachsen.
Was sonst noch dabei ist
Mit dem Launch kommen zwei Preisänderungen. Cache-Reads bei Sonnet 5.5 kosten seit dem 7. Oktober 0,10 $ pro Million Tokens, vorher waren es 0,20 $. Weil Cache-Reads einen großen Teil des Verbrauchs ausmachen, werden die meisten agentischen Aufgaben laut Anthropic rund 20 % günstiger.
Max- und Team-Abos bekommen ab dieser Woche ein monatliches API-Guthaben für die Claude Platform, 100 $ bei Max 5x und 200 $ bei Max 20x. Bei Team gibt es 20 $ je Standard-Seat und 100 $ je Premium-Seat, zusammengelegt und bei 500 $ im Monat gedeckelt. Freigeschaltet wird das Guthaben laut Hilfeartikel über eine verknüpfte Console-Organisation. Gedacht ist es für eigene Apps und Agents über die API, interaktive Sessions in Claude Code deckt es nicht ab. Dazu haben die SDKs für Python und TypeScript Beta-Klassen für Computer Use und Browser Use bekommen, und für beide Aufgaben hält Anthropic Haiku 5.5 für besonders geeignet.
Der hotte Take zum Schluss
Mit 26 Punkten mehr im Index macht Haiku 5.5 einen großen Schritt gegenüber dem Vorgänger, und im unteren Tarif steht es preislich gleichauf mit Luna. Da behalte ich dann aber trotzdem drei Fußnoten im Kopf: Die Haiku-Werte der Launch-Seite gelten für Max-Effort, der Tokenpreis gilt nur für Requests bis 100.000 Tokens, und was eine erledigte Aufgabe kostet, entscheidet der Verbrauch. Auf dem Default Medium misst Artificial Analysis 34 Punkte. Auf High erreicht Haiku mit 38 Punkten den Wert von Luna auf Max und braucht dafür etwas mehr Tokens.
Für Klassifizierung, Zusammenfassungen und Subagent-Jobs mit kurzem Kontext ist der Preis ein echtes Argument. In langen Agenten-Sessions, deren Requests über 100.000 Tokens wachsen, schrumpft der Vorteil auf die Hälfte des alten Preises, zumal Haiku auf den hohen Effort-Stufen reichlich Tokens verbrennt. Schauen wir mal, was der Praxistest so hervorzaubert.