> ## Content Index
> Fetch the complete content index at: https://t01.li/llms.txt
> Use this file to discover other available public pages before exploring further.

# Claude Haiku 5.5: ein Zehntel des Tokenpreises, solange der Prompt klein bleibt
- URL: https://t01.li/ki-news/claude-haiku-5-5-preis-benchmarks-subagents/
- Published: 2026-10-08T10:44:11.000Z
- Updated: 2026-10-08T10:44:11.000Z
- Description: Claude Haiku 5.5 kostet über die API bei Prompts bis 100.000 Tokens ein Zehntel des Tokenpreises von Haiku 4.5 und springt bei Artificial Analysis von 17 auf 43 Punkte. Die 43 gelten für Max-Effort, voreingestellt ist Medium. Was das Modell für Tool-Use und Subagents taugt.
- Author: Tobias Glawe
- Tags: KI News

Anthropic hat am 7\. Oktober *Claude Haiku 5.5* veröffentlicht, gut zwei Wochen nach [*Claude Opus 5.5*](https://t01.li/ki-news/claude-opus-5-5-fable-niveau-40-prozent-guenstiger/) und neun Tage nach [*Claude Sonnet 5.5*](https://t01.li/ki-news/claude-sonnet-5-5-benchmarks-preis-agenten/). Der Vorgänger *Haiku 4.5* ist rund ein Jahr alt. In den Benchmarks fällt der Abstand deutlich aus. Auf der [Launch-Seite](https://www.anthropic.com/claude-haiku-5-5?ref=t01.li) nennt Anthropic das neue Modell „the cheapest, fastest, and most capable small model we’ve ever released“ und senkt den API-Preis pro Token um 90 %, allerdings nur für Prompts bis 100.000 Tokens.

Zum Testen von *Haiku 5.5* komme ich erst heute und morgen in das über mehrere einzelene Projekte. In *Claude Code* mit Fokus auf Tool-Use und in der *Claude Desktop App* in [Projekten mit Threads](https://t01.li/ki-alltag/claude-projekte-koordinator-threads-anleitung/). Der Stand hier also ist deshalb die Papierlage vom Launch-Tag, ergänzt um die unabhängigen Messungen von Artificial Analysis.

## TL;DR 

Anthropics kleinstes Modell macht einen großen Sprung. Die Schlagzeilenwerte gelten aber für Max-Effort und für den günstigen Tarif bis 100.000 Tokens.

- API-Preis: 0,10 $ Input und 0,50 $ Output pro Million Tokens bei Prompts bis 100.000 Tokens, darüber das Fünffache. *Haiku 4.5* kostete 1 $ und 5 $. Der neue Tokenizer zählt denselben Text mit rund 30 % mehr Tokens.
- 1 Million Tokens Kontext, 128.000 Tokens Output, Effort von Low bis Max mit Medium als Voreinstellung, Adaptive Thinking standardmäßig aktiv.
- Artificial Analysis misst auf Max 43 Punkte (*Haiku 4.5*: 17), auf Medium 34\. Auf Max erzeugt das Modell pro Index-Aufgabe rund dreimal so viele Output-Tokens wie *GPT-6 Luna* auf Max.
- Gegen Prompt Injections ist *Haiku 5.5* im Gray-Swan-Benchmark deutlich robuster als der Vorgänger (Angriffserfolg 7,1 % gegenüber 83,2 %). Harmlose Anfragen lehnt es in Single-Turn-Tests seltener ab als *Haiku 4.5*, im automatisierten Verhaltensaudit der System Card am häufigsten von allen getesteten Modellen.
- In *Claude Code* zeigt der Alias `haiku` ab Version 2.1.293 auf der Anthropic-API auf *Haiku 5.5*, auf *Bedrock*, *Google Cloud*, *Foundry* und *Claude Platform on AWS* noch auf *Haiku 4.5*.

## Was Claude Haiku 5.5 kann und was es kostet

Anthropic zielt mit *Haiku 5.5* auf Arbeit in großen Mengen, bei der jeder Aufruf aufs Budget geht, also Zusammenfassungen, Compaction, Datenbankabfragen und Klassifizierung, dazu auf Aufgaben, bei denen es auf Tempo ankommt, etwa Kundensupport in Echtzeit und Browser Use. Beim Coding soll das Modell als Subagent neben *Opus 5.5* und *Sonnet 5.5* mitlaufen. Das schnellste Modell im Haus ist es laut Fußnote nur bei Standardgeschwindigkeit (*Opus* im Fast Mode zieht vorbei).

Technisch rückt der Kleine in der Familie an die großen Geschwister heran. Das [Kontextfenster](https://t01.li/glossar/#kontextfenster) wächst von 200.000 auf eine Million Tokens, der Output ist auf 128.000 Tokens begrenzt, und das Modell nimmt Text und Bilder entgegen, antwortet aber nur in Text. Der Knowledge Cutoff liegt laut [Modellübersicht](https://platform.claude.com/docs/en/about-claude/models/overview?ref=t01.li) im Juni 2026.

Neu für die Haiku-Linie ist der [Reasoning Effort](https://t01.li/glossar/#reasoning-effort) mit fünf Stufen von Low bis Max, voreingestellt ist Medium. Adaptive Thinking ist standardmäßig aktiv, das Modell entscheidet selbst, ob und wie lange es nachdenkt. Code, der für *Haiku 4.5* geschrieben wurde, kann laut [Release Notes](https://platform.claude.com/docs/en/release-notes/overview?ref=t01.li) Fehler werfen, weil ein festes Thinking-Budget per `budget_tokens` jetzt einen 400-Fehler auslöst und Antworten mit Thinking-Blöcken beginnen können.

Erreichbar ist das Modell über die *Claude API* als `claude-haiku-5-5` sowie über *Amazon Bedrock*, *Claude Platform on AWS*, *Google Cloud* und *Microsoft Foundry*. Die API-Preise im Überblick, laut Launch-Seite und [Modellseite](https://platform.claude.com/docs/en/models/haiku-5-5/overview?ref=t01.li):

| pro 1 Mio. Tokens    | Haiku 5.5 bis 100k | Haiku 5.5 über 100k | Haiku 4.5 | Sonnet 5.5 |
| -------------------- | ------------------ | ------------------- | --------- | ---------- |
| Input                | 0,10 $             | 0,50 $              | 1,00 $    | 2,00 $     |
| Output               | 0,50 $             | 2,50 $              | 5,00 $    | 10,00 $    |
| Cache-Read           | 0,01 $             | 0,05 $              | 0,10 $    | 0,10 $     |
| Cache-Write (5 Min.) | 0,125 $            | 0,625 $             | 1,25 $    | 2,50 $     |

## Ein Zehntel des Tokenpreises aber mit kleiner Fußnote

Anthropic beziffert die durchschnittliche Ersparnis gegenüber *Haiku 4.5* auf rund 75 %, die 90 % stehen erst in einer Fußnote. Der neue Preis gilt nur für Prompts bis 100.000 Tokens. Darüber kostet *Haiku 5.5* das Fünffache und liegt mit 0,50 $ und 2,50 $ immer noch bei der Hälfte von *Haiku 4.5*, das einen Einheitspreis hatte. In seine Kalkulation bezieht Anthropic ein, dass 90 % der Haiku-4.5-Requests unter der Schwelle lagen, und berücksichtigt den neuen [Tokenizer](https://t01.li/glossar/#tokenizer). Laut [Migrationsguide](https://platform.claude.com/docs/en/models/haiku-5-5/migration-guide?ref=t01.li#recount-tokens) zählt derselbe Eingabetext damit ungefähr 30 % mehr Tokens als bei *Haiku 4.5*, je nach Inhalt. Was eine erledigte Aufgabe am Ende kostet, hängt zusätzlich davon ab, wie lange das Modell nachdenkt.

Für z.B. Klassifizierung mit kurzen Prompts passt die Rechnung dann. In einem [Agent-Loop](https://t01.li/glossar/#agentic-loop), der den Verlauf weiterreicht, wächst der Prompt ohne Kürzung mit jedem Tool-Ergebnis. Überschreitet ein einzelner Request 100.000 Prompt-Tokens, greift für diesen Request der höhere Tarif. Ob gecachte Tokens dabei mitzählen, regelt Anthropic für *Haiku 5.5* nicht ausdrücklich. Die [Preisdoku](https://platform.claude.com/docs/en/about-claude/pricing?ref=t01.li#long-context-pricing) nennt die Prompt-Länge als Kriterium, und die [Doku zum Prompt Caching](https://platform.claude.com/docs/en/build-with-claude/prompt-caching?ref=t01.li#tracking-cache-performance) rechnet Cache-Reads und Cache-Writes zum gesamten Input eines Requests. Ich gehe deshalb davon aus, dass gecachte Tokens zur Schwelle zählen, eine ausdrückliche Abrechnungsregel dazu habe ich nicht gefunden. *Claude Code* lässt Haiku-5.5-Sessions laut [Doku zur Modellkonfiguration](https://code.claude.com/docs/en/model-config?ref=t01.li) bis rund 967.000 Tokens laufen, bevor es den Verlauf kompaktiert, ein kleineres Auto-Compact-Fenster lässt sich pro Modell setzen. Das probiere ich im Test als Erstes aus.

Im unteren Tarif landet *Haiku 5.5* exakt beim Preis von [*GPT-6 Luna*](https://t01.li/ki-news/gpt-6-sol-luna-openai-halbiert-api-preise/), das OpenAI vor gut zwei Wochen auf 0,10 $ und 0,50 $ gesenkt hat. *Luna* wird laut [Modellseite von OpenAI](https://developers.openai.com/api/docs/models/gpt-6-luna?ref=t01.li) erst bei mehr als 272.000 Input-Tokens teurer, dann kosten Input und Cache das Doppelte und Output das 1,5-Fache, jeweils für den ganzen Request.

## Hersteller-Sternchen: die Haiku-Werte gelten für Max

Die Benchmark-Tabelle auf der Launch-Seite vergleicht *Haiku 5.5* mit *Haiku 4.5*, *GPT-6 Luna* und, zur Orientierung, *Sonnet 5.5*. Die Werte stammen aus unterschiedlichen Quellen. GDPval-AA und AA-Briefcase hat laut [System Card](https://www.anthropic.com/claude-haiku-5-5-system-card?ref=t01.li) Artificial Analysis unabhängig gemessen, die übrigen Zahlen stammen von Anthropic. Die hervorgehobenen Haiku-Werte gelten für Max-Effort, voreingestellt ist Medium.

- Terminal-Bench 4.0 (agentisches Coding im Terminal): 39,2 %, gemittelt über zehn Durchläufe pro Aufgabe, *Haiku 4.5* kam auf 0,0 %, *Luna* auf 16,4 %, *Sonnet 5.5* auf 70,6 %
- OSWorld 2.1, Offline-Subset (Computer Use): 72,4 % als Teilpunktewert (Partial Score) gegenüber 15,7 % beim Vorgänger und 48,9 % bei *Luna*. Vollständig gelöst hat *Haiku 5.5* 37,1 % der Aufgaben (Strict Pass Rate), *Luna* 17,1 % und *Haiku 4.5* 1,7 %
- GDPval-AA v2.1 (Wissensarbeit, gemessen von Artificial Analysis): 1.620 Punkte, *Haiku 4.5* kam auf 735, *Luna* auf 1.437, *Sonnet 5.5* auf 1.840
- AA-Briefcase v1.1 (agentische Wissensarbeit, gemessen von Artificial Analysis): 1.578 Punkte, *Haiku 4.5* kam auf 614, *Luna* auf 1.336, *Sonnet 5.5* auf 1.824
- Humanity’s Last Exam: 45,9 % ohne und 57,4 % mit Tools (*Haiku 4.5*: 10,2 und 18,7 %)
- SWE-bench Multilingual: 83,7 % gegenüber 67,4 % bei *Haiku 4.5*

Die Sprünge sind groß, was auch am niedrigen Startpunkt liegt. Für die komplexen Aufgaben dieser Terminal-Bench-Version war *Haiku 4.5* mit 0 % keine brauchbare Wahl. Den Luna-Wert auf OSWorld hat Anthropic selbst über die OpenAI-API gemessen, eine unabhängige Drittmessung ist das nicht. Wie viel der Effort ausmacht, zeigen die beiden Messungen von Artificial Analysis. Auf Medium kommt *Haiku 5.5* bei GDPval-AA auf 1.277 Punkte (Max: 1.620) und bei AA-Briefcase auf 1.372 (Max: 1.578), braucht dafür aber nur etwa ein Zehntel beziehungsweise weniger als ein Viertel der Output-Tokens. Warum solche [Benchmark-Vergleiche zwischen LLMs](https://t01.li/ki-systemdesign/wenn-benchmarks-lugen-warum-der-llm-vergleich-kaputt-ist/) oft weniger hergeben, als die Tabelle verspricht, habe ich an anderer Stelle aufgeschrieben.

## Artificial Analysis: 43 Punkte auf Max, 34 auf Medium

Artificial Analysis misst – mann kennt das – unabhängig nach und kommt im Intelligence Index v4.3.2 für *Haiku 5.5* auf Max zu 43 Punkten, 26 mehr als bei *Haiku 4.5*. Damit liegt das Modell laut [Auswertung von Artificial Analysis](https://artificialanalysis.ai/articles/claude-haiku-5-5?ref=t01.li) knapp vor *GLM-5.3 Flash* (42) und [*Gemini 3.8 Flash*](https://t01.li/ki-news/gemini-3-8-flash/) (41), klar vor *GPT-6 Luna* (38) und in Reichweite von [*Kimi K3*](https://t01.li/ki-news/kimi-k3-frontier-leistung-zum-frontier-preis-die-billig-ara-ist-vorbei/) (44), einem Open-Weights-Modell mit 2,8 Billionen Parametern. *Sonnet 5.5* auf Max steht 13 Punkte höher.

Auf der [Release-Seite](https://artificialanalysis.ai/models/releases/claude-haiku-5-5?ref=t01.li) stehen alle fünf Effort-Stufen nebeneinander, und die Treppe ist steil. Low kommt auf 29 Punkte, Medium auf 34, High auf 38, Xhigh auf 41 und Max auf 43\. Im Default fehlen neun Punkte zur Schlagzeile. Bezahlt wird der Rest in Tokens: Auf Max erzeugt *Haiku 5.5* rund 162.000 Output-Tokens pro Index-Aufgabe (gewichteter Durchschnitt, Reasoning eingerechnet). Das sind mal eben fast dreimal so viele wie *Luna* auf Max. Der Schritt von Xhigh auf Max bringt zwei Punkte für das 1,8-Fache an Tokens. Auf High erreicht *Haiku* mit rund 55.000 Tokens pro Aufgabe dieselben 38 Punkte wie *Luna* auf Max mit rund 50.000, und auf den niedrigeren Stufen wächst der Abstand beim Tokenverbrauch laut Artificial Analysis noch.

Mit 244 Tokens pro Sekunde in der Ausgabephase landet *Haiku 5.5* auf Max bei Artificial Analysis auf Platz 9 von 182 vergleichbaren Modellen. Bis zum ersten Antwort-Token vergehen auf Low trotzdem knapp 13 Sekunden und auf Max über fünf Minuten, weil das Thinking mitzählt. Für kurze Support-Dialoge spricht diese Messung gegen Max als Voreinstellung. Ob Low oder Medium schnell genug reagieren, wird ein Test mit echten Support-Prompts zeigen.

Auf Terminal-Bench 4.0 liegt die Messung bei 33 % und damit gleichauf mit *GLM-5.3 Flash* und vor *Gemini 3.8 Flash* (20 %) und *Luna* (13 %). Bei AA-Omniscience beantwortet *Haiku 5.5* nur 36 % der Wissensfragen richtig, *Gemini 3.8 Flash* schafft 55 %, *Luna* 44 %. Dafür gibt das Modell öfter zu, etwas nicht zu wissen. Bei der Rate an [Halluzinationen](https://t01.li/glossar/#halluzination) kommt *Haiku 5.5* auf 40 %, *Gemini 3.8 Flash* auf 55 % und *Luna* auf 77 %. AA-Omniscience zählt dafür laut [Methodik](https://artificialanalysis.ai/evaluations/omniscience?ref=t01.li) die falschen Antworten unter allen nicht korrekt beantworteten Fragen, wozu auch teilweise richtige und ausgelassene gehören. Mit einer Fehlerquote über alle Antworten ist der Wert deshalb nicht zu verwechseln.

Einen Ausreißer nach unten erklärt Artificial Analysis gleich mit: Auf AutomationBench-AA, einem Test für agentische SaaS-Workflows, erreicht *Haiku 5.5* nur 35 %, die drei Konkurrenten liegen zwischen 53 und 60 %. Artificial Analysis vermutet, dass der Wert zu niedrig ausfällt, weil ein Problem mit Sicherheitsverweigerungen im Pre-Release-Test zu viele Ablehnungen ausgelöst hat. Anthropic arbeitet an einem Fix, danach will Artificial Analysis neu messen. Auch die Kosten pro Index-Aufgabe (vorläufig 0,21 $ auf Max) bilden den Stufentarif über 100.000 Tokens noch nicht ab.

## Tool-Use und Subagents: der eigentliche Job

Wofür Anthropic das Modell sieht, steht auf der Launch-Seite in einem Satz:

> „Haiku 5.5 is best suited to more narrowly scoped tasks that might otherwise have been cost-prohibitive with previous versions of Claude – like compaction, summarization, or subagent work.“

Für komplexes agentisches Coding empfiehlt Anthropic im selben Absatz weiterhin *Sonnet 5.5* und *Opus 5.5*. Ein großes Modell plant und entscheidet, *Haiku* holt Daten, fasst zusammen und erledigt die kleinen Schritte. Der Finanz-KI-Anbieter Rogo beschreibt das in einem der (von Anthropic ausgewählten) Kundenzitate so, dass ein größeres Modell die Präsentation baut, während ein Haiku-Subagent die passende Umsatzzeile aus dem Geschäftsbericht holt.

In *Claude Code* ist das ab Version 2.1.293 ohne Umweg nutzbar. Der Alias `haiku` zeigt auf der Anthropic-API auf *Haiku 5.5*, auf *Amazon Bedrock*, *Google Cloud*, *Microsoft Foundry* und *Claude Platform on AWS* noch auf *Haiku 4.5*. Nach dieser Logik landen Subagents, die per `model: haiku` definiert sind, auf der Anthropic-API beim neuen Modell. Thinking lässt sich bei *Haiku 5.5* in *Claude Code* nicht abschalten, gesteuert wird nur über den Effort. Ein paar Hebel gegen ausufernden Verbrauch habe ich bei der [Token-Effizienz in Claude Code](https://t01.li/ai-dev/token-effizienz-in-claude-code-was-hilft/) gesammelt.

Für Tool-Use ist ein Kapitel der System Card relevant, das im Launch-Post fehlt. Gegen indirekte [Prompt Injections](https://t01.li/glossar/#prompt-injection), also untergeschobene Anweisungen in Webseiten, Dateien oder Tool-Ergebnissen, ist *Haiku 5.5* robuster als der Vorgänger. Im Gray-Swan-Benchmark sinkt die Erfolgsquote eines Angreifers nach 15 Versuchen von 83,2 auf 7,1 %. Beim Coding liegt sie bei 0,2 %, bei [Tool Calling](https://t01.li/glossar/#tool-calling) bei 4,0 %, die größte Lücke ist Computer Use über die grafische Oberfläche mit 24,4 %. *Sonnet 5.5* (3,4 %) und *Opus 5.5* (1,0 %) sind insgesamt robuster. Getestet wurde mit Extended Thinking und ohne die zusätzlichen Schutzmaßnahmen gegen Prompt Injections, die Anthropic in seinen Produkten einsetzt. Wie oft ein Angriff auf eine konkrete Anwendung durchkommt, lässt sich aus dem Benchmark nicht ablesen.

Bei den Verweigerungen ist das Bild dann gemischt. In Single-Turn-Tests mit harmlosen, aber heiklen Anfragen lehnt *Haiku 5.5* seltener ab als *Haiku 4.5* (über die API 0,17 % gegenüber 0,44 %). *Sonnet 5.5* und *Opus 5.5* lehnen dort noch seltener ab. Im automatisierten Verhaltensaudit hat *Haiku 5.5* harmlose Anfragen dagegen häufiger verweigert als jedes andere getestete Modell. Der AutomationBench-Ausreißer passt zu dieser Beobachtung, eine gemeinsame Ursache belegt die System Card nicht. Für meinen Test heißt das, Verweigerungen von Anfang an mitzuloggen und genau hinzusehen, ob Medium für saubere Tool-Calls reicht und wie schnell einzelne Requests über die 100.000 Tokens wachsen.

## Was sonst noch dabei ist

Mit dem Launch kommen zwei Preisänderungen. Cache-Reads bei *Sonnet 5.5* kosten seit dem 7\. Oktober 0,10 $ pro Million Tokens, vorher waren es 0,20 $. Weil Cache-Reads einen großen Teil des Verbrauchs ausmachen, werden die meisten agentischen Aufgaben laut Anthropic rund 20 % günstiger.

Max- und Team-Abos bekommen ab dieser Woche ein monatliches API-Guthaben für die *Claude Platform*, 100 $ bei Max 5x und 200 $ bei Max 20x. Bei Team gibt es 20 $ je Standard-Seat und 100 $ je Premium-Seat, zusammengelegt und bei 500 $ im Monat gedeckelt. Freigeschaltet wird das Guthaben laut [Hilfeartikel](https://support.claude.com/en/articles/17154008-monthly-api-credits-for-max-and-team-plans?ref=t01.li) über eine verknüpfte Console-Organisation. Gedacht ist es für eigene Apps und Agents über die API, interaktive Sessions in *Claude Code* deckt es nicht ab. Dazu haben die SDKs für Python und TypeScript Beta-Klassen für Computer Use und Browser Use bekommen, und für beide Aufgaben hält Anthropic *Haiku 5.5* für besonders geeignet.

## Der hotte Take zum Schluss

Mit 26 Punkten mehr im Index macht *Haiku 5.5* einen großen Schritt gegenüber dem Vorgänger, und im unteren Tarif steht es preislich gleichauf mit *Luna*. Da behalte ich dann aber trotzdem drei Fußnoten im Kopf: Die Haiku-Werte der Launch-Seite gelten für Max-Effort, der Tokenpreis gilt nur für Requests bis 100.000 Tokens, und was eine erledigte Aufgabe kostet, entscheidet der Verbrauch. Auf dem Default Medium misst Artificial Analysis 34 Punkte. Auf High erreicht *Haiku* mit 38 Punkten den Wert von *Luna* auf Max und braucht dafür etwas mehr Tokens.

Für Klassifizierung, Zusammenfassungen und Subagent-Jobs mit kurzem Kontext ist der Preis ein echtes Argument. In langen Agenten-Sessions, deren Requests über 100.000 Tokens wachsen, schrumpft der Vorteil auf die Hälfte des alten Preises, zumal *Haiku* auf den hohen Effort-Stufen reichlich Tokens verbrennt. Schauen wir mal, was der Praxistest so hervorzaubert.