Claude Haiku 5.5 kostet über die API bei Prompts bis 100.000 Tokens ein Zehntel des Tokenpreises von Haiku 4.5 und springt bei Artificial Analysis von 17 auf 43 Punkte. Die 43 gelten für Max-Effort, voreingestellt ist Medium. Was das Modell für Tool-Use und Subagents taugt.
Googles neues Spitzenmodell Gemini 4 Argon schreibt bis zu 1 Mio. Tokens und glänzt in Herstellerbenchmarks. Nutzen dürfen es vorerst nur Cyber-Verteidiger, und laut Bloomberg zweifeln Google-Mitarbeitende am Frontend-Coding. Eine Einordnung der Papierlage.
GPT-6.1 Sol kommt sieben Tage nach GPT-6 Sol, zum gleichen Tokenpreis und mit halbiertem Cache-Preis. Ich hätte das fast als Iteration abgehakt. Artificial Analysis misst allerdings bis zu acht Punkte mehr, am deutlichsten auf Low und Medium.
Claude Sonnet 5.5 kostet so viel wie Sonnet 5 und liegt in Benchmarks nah an Opus 5.5. Artificial Analysis setzt ein Sternchen dran, und der Developer-Guide zeigt, wofür Anthropic das Modell wirklich sieht: als Arbeitspferd für wiederkehrende Agenten-Tasks.
OpenAI bringt GPT-6 Sol und Luna und senkt die API-Preise deutlich. Der Artificial-Analysis-Index bewegt sich kaum, einzelne Task-Evals schon. Was davon für Agenten und Pipelines zählt.
Anthropic bringt Claude Opus 5.5 auf Fable-5.1-Niveau mit 40 % weniger Betriebskosten. Artificial Analysis sieht das Modell im Intelligence Index vorn und misst auf Medium fast exakt diese Ersparnis gegenüber Opus 5. Preise, Benchmarks, Safeguards und was ich als Nächstes damit teste.
Jev von TypeSafe schreibt keinen Text, nur Wahrscheinlichkeiten – und soll 400-mal billiger sein als ein LLM. Was an dem Hype dran ist, wann 30 Zeilen Python die bessere Wahl bleiben, wofür Jev taugt und wie ein Einsatz mit personenbezogenen Daten in Deutschland aussieht.
GPT-6 Astra löst GPT-5.6 Sol als OpenAIs Spitzenmodell ab. Der Sprung liegt bei Computer Use, langen Codex-Sessions und Cyber-Fähigkeiten – nicht im unabhängigen Intelligence Index. Die Tokenpreise steigen auf das 2,5-Fache, die Kosten pro Aufgabe nicht überall.
Gemini 3.8 Flash legt bei Agenten und Coding zu. Warum gleicher Tokenpreis nicht gleiche Kosten bedeutet, was die Time per Task verrät und welche Thinking-Stufe für produktive Workflows taugt.
Meta legt Muse Spark 1.3 nach. Artificial Analysis misst einen klaren Sprung bei Agenten-Aufgaben – bei unverändert niedrigen Tokenpreisen. Warum das Modell bei mir auf die Testliste kommt.