Seit 2012 im Online-Marketing. Heute: Prompt Engineering, KI-Agenten und Automatisierung im Agenturalltag. Was davon wirklich funktioniert – und was nicht – steht hier.
Moonshot liefert mit Kimi K3 das größte „offene“ Modell aller Zeiten – 2,8 Billionen Parameter, unabhängig auf Augenhöhe mit Opus 4.8 gemessen. Nur die Weights fehlen noch, und der Preis beendet die Billig-Ära chinesischer Modelle.
Am 2. August 2026 wird die KI-Verordnung scharf – für die meisten KMU ist das aber kein Drama. Der Digital Omnibus hat die strengen Hochrisiko-Fristen verschoben. Der Vier-Fragen-Selbstcheck zeigt, ob dich die Stufe betrifft – und was trotzdem für alle gilt.
Hy3, LongCat-2.0 und Grok 4.5, Pekings Exportbremse, Cloudflares neue Bot-Regeln, BSI-A5, EDSA-Leitlinien und OpenAIs Benchmark-Rückzieher – die Picks der 28. Kalenderwoche.
GPT-5.6 mit Sol, Terra und Luna ist da, dazu ChatGPT Work und die Voice-Modelle GPT-Live. Warum ich als Plus-Nutzer zunächst trotzdem auf GPT-5.5 sitze (im Web-Chat), was die Benchmarks hergeben – und warum diesmal beide großen Labs durch einen Regierungs-Filter mussten.
Reasoning ist zum Default geworden – bezahlt wird jeder Denk-Token zum Output-Preis. Warum die Mehrheit der KMU-Aufgaben kein Denkmodell braucht, wo Reasoning wirklich trägt und wie du mit drei Fragen routest, statt Dauervollgas zu bezahlen.
Ich wollte nur schnell sehen, welche Bots meinen Server-Log vollmüllen. GoAccess und Logdy waren mir dafür zu viel Setup, also habe ich LogWerk gebaut: browser-basiert, deine Daten bleiben lokal, erkennt 60 Bots samt KI-Crawlern wie GPTBot und ClaudeBot. v1.2, ausbaufähig, Feedback erwünscht.
Fable 5 ist zurück, und die Begründung wiegt schwerer als die Rückkehr. Dazu markiert Claude Code Requests still per Unicode, LangChain bringt OpenWiki, Google TabFM für Tabellen und OpenAI teasert mit Codex Micro seine erste Hardware. Die AI Picks der 27. KW mit Einordnung.
Marker, Validierungs-Rollen, ein Tribunal aus fünf simulierten Experten: Viele Prompts sollen sich selbst prüfen. Nur sichert die Hälfte davon nichts ab. Drei Sorten QA-Gates, sortiert nach Wirkung – und warum das stärkste nie dasselbe Modell auswertet, das den Text geschrieben hat.
Anthropic hat Claude Sonnet 5 veröffentlicht: agentischer als der Vorgänger, bei einzelnen Benchmarks auf Opus-4.8-Niveau und günstiger. Der neue Tokenizer frisst den Preisvorteil aber teilweise wieder auf. Eine nüchterne Einordnung, kurz nach Launch.
Es gibt jetzt ein drittes Kürzel: AEO. Gemeint ist diesmal keine Sichtbarkeit. Ein Agent soll auf deiner Seite handeln. Die Technik dafür steht – WebMCP, Aktions-Schema, Bezahl-Protokolle. Warum sie trotzdem vorerst eine Nische bleibt und ab wann sich der Aufwand lohnt.