KI funktioniert. Nur selten so, wie es beschrieben wird.
Was generative KI in echten Projekten taugt, was maßlos überschätzt wird und wo Versprechen auf Realität trifft – mit Meinung, für Entscheider und Praktiker.
Die llms.txt gilt vielen als Pflicht für die KI-Sichtbarkeit. Ich habe drei Monate Server-Logs von fünf Websites mit Logwerk ausgewertet: Kein einziger Search- oder AI-Bot ruft die Datei ab. Google ignoriert sie offiziell. Wo sie trotzdem taugt und wo nicht.
GPT-6 Astra, Claude Fable 5.1, Muse Spark 1.3 und Gemini 3.8 Flash in vier Tagen, dazu Qwen3.8-Max-0902, iFlyteks Spark-X2.5, Quasar 438B mit chinesischem Motor, Metas Transkriptionsmodell für 0,18 $ die Stunde und drei Handwerksstücke zu Agenten-Infrastruktur.
GPT-6 Astra löst GPT-5.6 Sol als OpenAIs Spitzenmodell ab. Der Sprung liegt bei Computer Use, langen Codex-Sessions und Cyber-Fähigkeiten – nicht im unabhängigen Intelligence Index. Die Tokenpreise steigen auf das 2,5-Fache, die Kosten pro Aufgabe nicht überall.
Gemini 3.8 Flash legt bei Agenten und Coding zu. Warum gleicher Tokenpreis nicht gleiche Kosten bedeutet, was die Time per Task verrät und welche Thinking-Stufe für produktive Workflows taugt.
Meta legt Muse Spark 1.3 nach. Artificial Analysis misst einen klaren Sprung bei Agenten-Aufgaben – bei unverändert niedrigen Tokenpreisen. Warum das Modell bei mir auf die Testliste kommt.
Drei aktuelle Studien zeigen dasselbe Muster: Bei KI-Agenten entscheiden Datenqualität, enger Scope und klare Ownership oft mehr als die Modellwahl. Was McKinsey, Salesforce und Teradata dazu messen – und welche drei Fragen vor dem Modellnamen gehören.
Anthropic veröffentlicht Claude Fable 5.1 und Mythos 5.1 als identisches Modell mit verschiedenen Safeguards. Auf Terminal-Bench 4.0 trennen sie 5,1 Punkte – nur wurden dafür noch die älteren, gröberen Filter gemessen.
Drei chinesische Open-Weights-Modelle in drei Tagen, zwei Dokumenten-Parser, ein gekaperter Claude Code Auto Mode, OpenAIs Cursor-Rauswurf nach der SpaceXAI-Übernahme und Metas geplatztes Project OT – der Wochenrückblick der 35. KW.
Auto Mode ist seit Mitte August Default in Claude Code – der Agent fragt nicht mehr bei jedem Schritt. Warum ich ihn auf meinem t01.li-Stack machen lasse, wo der eigentliche Steuerungshebel liegt und wann Accept edits die bessere Wahl bleibt.
ChatGPT sucht seit dem 8. August gezielt innerhalb einzelner Domains, Hetzner erklärt schonungslos, warum sein Inference-Experiment einknickte, und auf OpenRouter verschenkt ein anonymes Lab Frontier-Kapazität. Dazu Multica, dessen Lizenz nur so aussieht wie Apache 2.0.