AI Picks der 40. KW
Sonnet 5.5, GPT-6.1 Sol und Gemini 4 Argon in einer Woche, dazu ein vollgepackter OpenAI DevDay mit Dots, MCP Extensions und MCP Events. Außerdem: Claude Code Mods, AG-UI 1.0, Vast-10M mit 10 Mio. Tokens Kontext und die Frage, wer haftet, wenn Agenten fremde Systeme hacken.
Wer dachte: „Hey, das wird doch bestimmt mal weniger diese Woche mit den neuen Modellankündigungen“: Pustekuchen. Die drei großen US-Labs haben zugeschlagen, genau wie schon letzte Woche. Ansonsten ist erwartungsgemäß jede Menge beim OpenAI DevDay 2026 hinten rausgefallen, und das werden wir hier zumindest in Teilen mal gepflegt sezieren.
Dann mal auf in eine (den Umständen geschuldet) reichlich OpenAI-lastige 40. Kalenderwoche des Jahres 2026.
Claude Sonnet 5.5
Anthropic hat am 28. September Claude Sonnet 5.5 veröffentlicht und positioniert es klar als Arbeitspferd für wiederkehrende Agenten-Tasks. Der Preis bleibt bei 2 $ Input und 10 $ Output pro Million Tokens, das Kontextfenster liegt bei 1 Mio. Tokens. In den unabhängigen Messungen von Artificial Analysis rückt Sonnet 5.5 tatsächlich nah an Opus 5.5 heran – allerdings nur, wenn man den Effort bis zum Anschlag aufdreht. Auf Max liegt Sonnet mit 56 Punkten nur zwei hinter Opus und produziert dafür Token, als gäbe es Bonusmeilen: rund 193.000 Output-Tokens pro Index-Task, so viel hat Artificial Analysis noch bei keinem Modell gemessen. Mit 7,62 $ pro Task ist Sonnet auf Max damit teurer als Opus auf Max (5,98 $).
Auf Medium und High sieht die Rechnung mit 0,59 $ beziehungsweise 1,08 $ pro Task vernünftig aus. Nur liegt Sonnet dort sieben bis zehn Punkte hinter Opus auf derselben Stufe, und Opus auf Low (42 Punkte, 0,55 $) schlägt Sonnet auf Medium (41 Punkte, 0,59 $) bei Leistung und Preis gleichzeitig. Wer API-Agenten migriert, sollte vorher die Breaking Changes lesen, denn thinking: disabled und ein erzwungenes tool_choice lehnt Sonnet 5.5 jetzt ab.
Mein kleiner Take: Für klar umrissene Alltagsaufgaben passt Sonnet 5.5 gut. Wer Opus-Niveau will, fährt mit Opus 5.5 und seinen gesenkten Preisen aktuell günstiger.
GPT-6.1 Sol
GPT-6.1 Sol ist am 29. September erschienen, nur sieben Tage nach GPT-6 Sol und Luna – und die Nachkommastelle bewegt diesmal mehr als die ganze Versionsnummer davor. Der reguläre API-Preis bleibt bei 2 $ Input und 10 $ Output pro Million Tokens, Cached Input wird mit 0,10 $ allerdings noch einmal halbiert. Dazu bleiben 1,05 Mio. Tokens Kontext und 128.000 Output-Tokens. Eine praktische Änderung gibt es trotzdem: reasoning_effort: none fällt weg, und Tool Calling funktioniert laut OpenAIs Migrationshinweisen nur noch über die Responses API. Einfach die Model-ID austauschen und Feierabend machen ist also nicht überall drin.
Bei Artificial Analysis steigt GPT-6.1 Sol auf Medium im Intelligence Index von 40 auf 48 Punkte und erreicht damit genau den Max-Wert des Vorgängers – bei rund einem Fünftel der dort gemessenen Kosten pro Index-Task (0,21 $ statt 1,04 $). Auch Low legt um acht Punkte zu, während Max von 48 auf 52 steigt und damit nur noch einen Punkt hinter GPT-6 Astra liegt, das pro Task gut das Viereinhalbfache kostet. Dafür wird es oben rum gemütlich. Artificial Analysis misst auf Max aktuell knapp 290 Sekunden bis zum ersten Antwort-Token.
Nächster heißer Take: Medium ist hier der neue Default, Max eher etwas für dich, wenn du zwischendurch gern Kaffee holen gehst und die Kreditkarte locker sitzen hast.
Gemini 4 Argon
Google hat am 30. September mit Gemini 4 Argon sein neues Spitzenmodell vorgestellt, und zumindest auf dem Papier steht das weit oben im Regal. Argon bietet bis zu 1 Mio. Output-Tokens (der Vorgänger kam auf 64.000), kostet zum Start 2 $ Input und 10 $ Output pro Million Tokens und liegt in Googles eigener Vergleichstabelle in gut zwei Dritteln der Zeilen allein vorn. Der Startpreis ist allerdings ein Einführungsrabatt, danach will Google 4 $ und 20 $ sehen – Opus-Niveau also. Artificial Analysis sieht das ein ganz klein wenig nüchterner und misst auf der höchsten derzeit verfügbaren Stufe 53 Punkte im Intelligence Index. Das reicht für einen Gleichstand mit GPT-6 Astra und Claude Fable 5.1 und einen Punkt Vorsprung auf GPT-6.1 Sol, aber nicht gegen Claude Opus 5.5 (58) und Sonnet 5.5 (56).
Spannend für Agenten ist die Attack Success Rate bei indirekter Prompt Injection. Im Gray-Swan-Benchmark nennt Google für Argon 0,7 %, Opus 5.5 liegt bei 1,0 % und GPT-6 Astra bei 8,5 %.
Es gibt aktuell einen kleinen Schönheitsfehler: Ausprobieren darf Argon zum Start fast niemand. Zunächst bekommen ausgewählte „Cyber-Verteidiger“ aus Googles Fairwind-Programm Zugriff, laut SecurityWeek rund 650 Partner aus Behörden, Cloud-Kundschaft und Security-Firmen. Für normale API-Kunden gibt es nur ein „as soon as possible“. Beim Coding bleibt das Bild gemischt, mit starken Werten in einigen Software-Evals wie DeepSWE, aber deutlich schwächeren auf Terminal-Bench 4.0 (57,4 % gegenüber 66,4 % bei Opus 5.5). Dazu berichtet Bloomberg von Google-Mitarbeitenden, die mit Argon bei bestimmten Coding-Aufgaben hadern, einer nannte explizit das Frontend-Design. Ich würde mir also den Pokal noch nicht gravieren lassen.
OpenAI DevDay 2026 Recap
OpenAI hat am 29. September beim DevDay 2026 in San Francisco laut eigener Zählung mehr als 20 Neuerungen auf einmal abgeladen. Neben GPT-6.1 Sol gibt es eine Ultrafast-Stufe, die in Codex bis zu 300 Tokens pro Sekunde liefern soll – vorerst allerdings nur mit GPT-6 Astra und nur in den Plänen Pro 500 und Enterprise, Sol Ultrafast ist „coming soon“. Dazu kommen Codex in der Cloud, Code Review, Security-Scans ganzer GitHub-Repositories und eine neue Decisions API, die GPT-6 Luna auf Entscheidungen aus einem fest definierten Ergebnisraum trimmt (vorerst als Limited Preview). Recht interessant ist die Agents API: Computer Use, Multi-Agent-Funktionen, Tool Search, Tool Calling und Context Compaction lassen sich damit direkt in eigene Anwendungen holen. Über Bedrock Managed Agents laufen OpenAI-Agenten außerdem vollständig innerhalb von AWS.
Parallel baut OpenAI ChatGPT konsequent vom Chatfenster zur Arbeitsplattform um. Es gibt Spaces und Pages für gemeinsame Arbeit, Team-Tasks mit Zeit- oder Event-Triggern, ChatGPT direkt in Slack (das kennen wir schon von Claude) und Teams – beides nur für Business und Enterprise – sowie ein Meetings-Plugin als Beta für die Mac-App. Kollaborative Slides sind angekündigt, aber noch nicht da. Obendrauf kommen „Sign in with ChatGPT“ und die Möglichkeit, Teile des eigenen Plus- oder Pro-Kontingents bei 16 Partnerdiensten wie Devin, Notion oder Vercel zu verwenden.
Das ist inzwischen weniger ein einzelnes Produkt-Update als der Versuch, ChatGPT, Codex, API und Drittanbieter zu einem großen Arbeitsbetriebssystem zusammenzuschrauben. Ob man da noch den Überblick behält, dürfte die anspruchsvollere Eval sein. Wer alles auf einmal will, liest den offiziellen Recap. Dots, MCP Extensions, MCP Events und die runderneuerte Codex CLI bekommen hier gleich noch jeweils einen eigenen Pick.
OpenAI Dots
Ebenfalls auf dem DevDay vorgestellt wurden Dots, eine Art dauerhafte Arbeitsagenten. Sie basieren auf GPT-6 Astra, bekommen einen eigenen Cloud-Computer samt Browser und können über Plugins auf mehr als 4.000 Apps zugreifen. Sie sollen Projekte über längere Zeit verfolgen, mehrere Aufgaben parallel bearbeiten und sich über ChatGPT, Slack oder Teams ansprechen lassen. Neu daran ist der permanente Kontext. Ein Dot merkt sich Ziele, Vorgaben und Feedback und soll daraus mit der Zeit ein halbwegs brauchbares Arbeitsprofil ableiten – weniger Chatfenster also, mehr dauerhaft laufender Agent mit eigenem Rechner.
Ganz ohne Leine läuft das Ding allerdings nicht. Für Hintergrundrecherche dürfen Dots verbundene Apps nur lesend verwenden, Aktionen lassen sich per Custom Rules erlauben, sperren oder unter Freigabe stellen. Sensible Dinge wie eine Passwortänderung bleiben immer bei dir. Laut Help Center bildet ein Dot aber auch proaktiv Memories aus verbundenen Daten, ohne dass du überhaupt gefragt hast – für Datenschutzbeauftragte dürfte das der interessantere Satz sein. Für Unternehmen testet OpenAI zusätzlich Specialist Dots mit eigener Identität, eigenen Credentials und abgegrenzten Zuständigkeiten, vorerst in Enterprise-Piloten.
Der Rollout startet für Pro und Business Premium, der erste Dot ist im Plan enthalten, und Enterprise kann die Beta administrativ freischalten. Jetzt kommt der Haken für uns. Pro-Accounts im EWR, in der Schweiz und in Großbritannien bleiben vorerst außen vor, einen Grund nennt OpenAI nicht. Business Premium soll dagegen in allen unterstützten Regionen laufen, also auch hierzulande. Die Ankündigung gibt’s übrigens auch auf Deutsch.
OpenAI MCP Extensions
Auch neu: OpenAI baut MCP um eine eigene Schicht für ChatGPT aus. Mit den MCP Extensions können Plugins unter anderem direkt in der Sidebar auftauchen, eigene Dateitypen öffnen und bearbeiten, Ressourcen per @Mention in den Composer bringen, Einstellungen anbieten oder komplexere Formulare anzeigen. Dazu gibt es SDKs für TypeScript und Python (Letzteres nur serverseitig) unter Apache-2.0-Lizenz. Aus einem MCP-Server wird so eher eine „richtige“ ChatGPT-App als eine Sammlung von Tools hinter einem Protokoll.
Der Haken steckt schon im Namen, denn das sind OpenAI-Erweiterungen und nicht MCP. Wer sie nutzt, bekommt eine wesentlich bessere Integration in ChatGPT und gibt dafür einen Teil der Portabilität auf – Claude, Gemini oder andere MCP-Hosts müssen mit diesen Funktionen nichts anfangen können. OpenAI schreibt das in der Spezifikation sogar selbst offen hin. Dazu ist der Plattform-Support noch löchrig. File-Handler und Composer-Mentions funktionieren zum Start nur auf dem Desktop, die Formulare nicht auf iOS und Android, und mit „Web“ meint OpenAI ausschließlich den Work-Browser, das klassische ChatGPT bleibt außen vor. Für ernsthafte ChatGPT-Plugins ist das spannend, als Beweis, dass MCP plötzlich zum universellen App-Framework geworden ist, taugt es eher nicht.
ChatGPT MCP Events
Und noch was mit MCP: OpenAI bringt Events in ChatGPT – und damit einen Baustein, der Agenten bisher gefehlt hat. Statt ständig selbst nach Änderungen zu fragen, kann ChatGPT jetzt Ereignisse abonnieren, etwa einen neuen Kommentar im Dokument oder eine neue Nachricht im Feedback-Kanal. Der MCP-Server meldet das Ereignis per signiertem Webhook zurück, und ChatGPT führt anschließend die Aktion aus, die du vorher definiert hast. Aus „prüfe regelmäßig, ob sich etwas geändert hat“ wird damit tatsächlich ein eventgetriebener Workflow.
Ganz so universell, wie „MCP Events“ zunächst klingt, ist das noch nicht. Die Funktion läuft aktuell nur in Work-Chats im Web, in der Desktop-App mit Cloud-Option und in Dots. Sie setzt die MCP-Spezifikation 2026-07-28 voraus, die OpenAI „MCP 2.0“ nennt, obwohl das MCP-Projekt selbst nur nach Datum versioniert. Die Events-Spezifikation ist dagegen noch ein Entwurf, und den setzt OpenAI nur teilweise um: Webhooks ja, Polling und Streaming nein, die Kontrollnachrichten gap und terminated fehlen ebenfalls. Serverseitig kommen persistente Subscriptions, Signaturen nach Standard Webhooks, Retry-Logik und Idempotenz dazu. Kleine Pointe am Rande: Ausgerechnet die Spec-Version 2026-07-28 hat MCP gerade erst zustandslos gemacht. Technisch ist das ein wichtiger Schritt Richtung proaktive Agenten, nur wird aus einem MCP-Server dadurch nebenbei auch ein kleiner Event-Broker.
Introducing AG-UI 1.0
AG-UI 1.0 ist seit dem 30. September offiziell da und versucht, das Frontend-Chaos bei Agenten zu zähmen. Das offene Protokoll standardisiert die Kommunikation zwischen Agent-Backend und Benutzeroberfläche über einen gemeinsamen Event-Stream. Den Transport lässt AG-UI offen, in der Praxis läuft es meist auf HTTP mit Server-Sent Events hinaus. Statt für LangChain, Google ADK, Mastra oder Claude Managed Agents jeweils eigene Streaming-Logik zu bauen, definiert AG-UI gemeinsame Events für Runs, Tool Calls, State-Updates und Token-Streaming. Version 1.0 bringt erstmals eine stabile Spezifikation samt JSON Schema, aus dem die SDKs für TypeScript, Python und .NET generiert werden. Laut CopilotKit setzen Google, Microsoft, Amazon und Oracle das Protokoll bereits ein. Ein kleiner Dämpfer zur eigenen Werbung: Das OpenAI Agents SDK, das im Blogpost als unterstützt auftaucht, steht in der Integrationsliste im Repo noch auf „In Progress“, und die Anbindung an Claude Managed Agents ist eine Community-Integration, keine von Anthropic.
Interessant ist 1.0 vor allem bei Dingen, die Agenten im echten Produkt irgendwann ohnehin brauchen. Subagents bekommen eigene IDs, Tool-Ergebnisse dürfen Bilder, Audio, Video und Dokumente enthalten, Human-in-the-loop-Interrupts pausieren Runs sauber, und den Tokenverbrauch kann man bis ins Frontend durchreichen. Vereinfacht gesagt kümmert sich MCP darum, wie Agenten an Tools kommen, A2A um die Kommunikation zwischen Agenten, und AG-UI will das fehlende Kabel zwischen Agent und Oberfläche standardisieren. Noch ein Protokoll also, nur schließt dieses hier eine Lücke, die es wirklich gibt.
Codex CLI just got a major refresh
OpenAI hat der Codex CLI einen größeren Frühjahrsputz verpasst – nur eben erst Ende September. Das Terminal-UI läuft inzwischen im Fullscreen-Modus, längere Sessions lassen sich durchsuchen und besser scrollen, und parallele Arbeit wird mit Agent-Übersicht, Forks und eigenen Git-Worktrees deutlich brauchbarer. Dazu kommen Voice, Usage-Statistiken per /usage, sechs neue Themes sowie direkt im Terminal gerenderte Mermaid-Diagramme und Formeln. Gerade die Worktrees sind praktisch, weil ein zweiter Lösungsweg nicht mehr zwangsläufig damit anfängt, dass man sich selbst einen kleinen Git-Unfall baut. Dass man damit zusätzliche Tokens durchbläst, brauche ich wohl niemandem zu erzählen.
Den Begriff „major refresh“ hat OpenAI in der Ankündigung auf X großzügig ausgelegt. Das ist kein einzelnes großes Release, sondern die Zusammenfassung mehrerer CLI-Versionen aus dem September. Worktrees, Voice und die Agent-Übersicht steckten experimentell schon in 0.154.0 und 0.155.0, zum Standard wurde der Großteil mit 0.156.0 und 0.157.0, und 0.158.0 sowie 0.159.0 (Letztere vom Tag der Ankündigung) lieferten vor allem Feinschliff. Die inzwischen erschienene 0.160.0 gehört übrigens nicht mehr dazu, wie der Codex-Changelog zeigt. Unterm Strich trotzdem ein sinnvolles Update: Codex entwickelt sich im Terminal gerade vom Chatfenster mit Shell-Zugriff zur Arbeitsoberfläche für mehrere parallele Coding-Agenten.
Claude Mods
Anthropic hat am 1. Oktober Mods für Claude Code vorgestellt und öffnet Claude Code damit noch ein Stück weiter. Im Grunde sind das „kleine“ TypeScript-Funktionen (JavaScript geht auch), die direkt in interne Events eingreifen: Prompts umschreiben, Tool-Calls blockieren oder verändern, Berechtigungsanfragen beantworten, Secrets aus Ausgaben filtern oder Teile der Oberfläche ersetzen. Blockieren konnten klassische Hooks auch schon, Events umschreiben, eigene UI zeichnen oder ganze Features ersetzen können aber nur Mods. Einige Funktionen von Claude Code sind bereits so umgesetzt, darunter /diff, die Telemetrie und die Unterstützung für AGENTS.md. Seit Version 2.1.287 sind Mods standardmäßig aktiv.
Das ist mächtig, und genau deshalb sollte man bei der Plugin-Romantik kurz den Fuß vom Gas nehmen. Mods laufen nicht in einer Sandbox, sondern mit denselben Rechten wie Claude Code selbst. Ein fremder Mod ist damit kein Prompt-Snippet, sondern ausführbarer Code mit tiefem Zugriff auf den Agenten und deinen Rechner. Für Teams lädt Anthropic deshalb automatisch den eingebauten Mod sec-default, der Managed Settings und Deny-Regeln vor nachgeladenen Mods schützt. Den Dämpfer liefert die Doku gleich mit, denn der Schutz gilt nur für Claudes eigene Tool-Calls. Ist Read(.env) verboten, kann ein Mod die Datei trotzdem über $.fs.read lesen. Das README im Repo warnt außerdem, dass sich die API zwischen Releases ohne Vorwarnung ändern kann. Wer Claude Code im Auto Mode laufen lässt, sollte also genau wissen, welche Mods da mitlaufen.
Steile These: ein interessantes Fundament für eigene Workflows – nur eher „VS-Code-Extension mit Agentenrechten“ als „kleines Claude-Add-on“. Für den Einstieg hat Addy Osmani ein Tutorial zu den ersten eigenen Mods geschrieben, womit wir direkt beim nächsten Pick wären.
claude.dev
Anthropic hat mit claude.dev eine eigene Anlaufstelle für alle gebastelt, die mit Claude entwickeln. Aus der Ankündigung auf X vom 30. September:
You’ll find engineering deep dives, Claude Code and API guides, tips from the teams building Claude, and some fun easter eggs.
Komplett neu ist das Material nicht, der Blog reicht bis April zurück. Gesammelt an einem Ort ist es trotzdem angenehmer. Und wenn ihr so etwas Altmodisches wie einen Feed-Reader benutzt (finde ich ja nach wie vor sehr praktisch), ist das hier euer Way to go: claude.dev/rss.xml
DeepSeek Harness for Desktop Is Here
Desktop ist das neue Terminal, dachte man sich auch bei DeepSeek, und tadaaa: DeepSeek Harness gibt es jetzt als Desktop-App für macOS und Windows, frisch in einen Release Candidate gegossen (v0.2.0-rc.2 vom 29. September). Bisher lief das Harness vor allem als Web-UI, die man per npx startet, das dsh-Kommando bringt die App jetzt gleich mit. Linux schaut vorerst in die Röhre. Und immerhin trauen sie dem Ding mittlerweile so viel zu, dass sie es offen bewerben, mit eigener Website, einem Artikel auf X und so. Laut DeepSeek nutzen rund 60 % der Harness-Nutzenden Drittanbieter-Plugins, und die Desktop-Version soll den Coding-Agenten auch für Leute ohne Terminal-Routine zugänglich machen. Vor zwei Wochen gab’s ja schon experimentelle Browser- und Computer-Use-Funktionen.
Der Sicherheitshinweis im Repo ist trotzdem unverändert aktuell:
DeepSeek Harness is experimental developer-preview software. It has not undergone a security audit and must not be treated as secure or production-ready.
Wenn ihr das Ding installiert, dann also am besten in eine eigene, abgeschottete Umgebung. Genau das empfiehlt DeepSeek selbst mit einer „disposable virtual machine“.
Who’s liable when AI agents go rogue?
Wer haftet eigentlich, wenn ein KI-Agent Dinge tut, die er eindeutig nicht tun sollte? Die Frage ist mal komplett berechtigt, und Michelle Kim nimmt sie in der MIT Technology Review anhand einer ganzen Kaskade von Vorfällen auseinander. OpenAI-Agenten sind im Juli aus ihrer Sandbox ausgebrochen und bei Hugging Face eingestiegen, um bei einem Cybersecurity-Test zu schummeln. Anthropic hat im September vier Vorfälle offengelegt, bei denen Claude während Security-Evaluationen in fremde Systeme eingedrungen ist, und Google bestätigte, dass Gemini im Mai drei Unternehmen gehackt hat – bei einem Test von Irregular, den ich letzte Woche schon auf dem Zettel hatte. Rechtlich passt das schlecht ins Raster. Kalifornien (SB 53), New York (RAISE Act) und Illinois (SB 315) haben zwar Gesetze für Frontier-Modelle verabschiedet, die teils erst 2027 oder 2028 greifen, deren Meldepflichten zielen aber vor allem auf schwerwiegende beziehungsweise katastrophale Sicherheitsvorfälle. Mackenzie Arnold vom Institute for Law and AI fasst das so zusammen:
Only the worst, most egregious, most immediately harmful stuff is going to qualify.
Und exakt da wird Agentic AI unangenehm praktisch. Wenn ein Agent selbstständig Tools nutzt, Accounts anlegt oder fremde Systeme erreicht, verteilt sich die Verantwortung irgendwo zwischen Modellanbieter, Betreiber und demjenigen, der ihm die Schlüssel gegeben hat. Der Artikel selbst schaut vor allem auf die Entwickler der Modelle, für Unternehmen ist die Betreiberrolle aber die spannendere. „Der Agent war’s“ dürfte vor Gericht jedenfalls eine eher überschaubare Verteidigungsstrategie sein.
Bleibt noch der Blick in die EU: Die geplante KI-Haftungsrichtlinie hat die Kommission 2025 mangels Aussicht auf Einigung zurückgezogen. Übrig ist die neue Produkthaftungsrichtlinie, die Software ausdrücklich als Produkt behandelt und bis zum 9. Dezember 2026 in nationales Recht umgesetzt sein muss. Ersetzt werden neben Personenschäden aber nur Schäden an Sachen und Daten, die nicht beruflich genutzt werden. Ein Agent, der sich durch Firmensysteme fräst, fällt also gerade nicht darunter, und man landet wieder beim allgemeinen Deliktsrecht und bei Verträgen. Der AI Act verlangt von Anbietern großer Modelle mit systemischem Risiko zwar, schwerwiegende Vorfälle ans AI Office zu melden, auch dort liegt die Latte aber bei „schwerwiegend“. Governance wird damit spätestens dann vom PowerPoint-Thema zum Betriebsproblem, wenn Agenten echte Berechtigungen bekommen. Wer dann Daten, Scope und Ownership nicht sauber geklärt hat, hat das Haftungsproblem am Ende selbst im Haus.
TypeSafe AI n8n Community Node
Jev, das Entscheidungsmodell von TypeSafe, das ich mir neulich schon genauer angeschaut habe, hat jetzt einen offiziellen, von n8n verifizierten Community Node – im Kern ein semantischer If-/Switch-Node für Entscheidungen, die sich nicht sauber als Regel formulieren lassen. Ein Workflow schickt Text, JSON oder gleich das ganze Item an Jev und bekommt Choice-, Score- oder Ja/Nein-Entscheidungen zurück (Letztere heißen bei TypeSafe „Noul“). Hipper wird es bei den Wahrscheinlichkeiten: Liegt die Confidence unter einem definierten Schwellwert, landet das Item in einem eigenen Fallback-Output und von dort beispielsweise in der menschlichen Prüfung. Support-Tickets sortieren, Leads bewerten oder E-Mails klassifizieren sind naheliegende Anwendungen. Auf n8n Cloud läuft Jev über Gateway Credits und ist laut n8n-Community bis zum 10. Oktober sogar kostenlos, beim Self-Hosting braucht ihr einen eigenen TypeSafe-API-Key.
Das Video von n8n (wirkt stellenweise etwas cringe) verkauft das stellenweise ungefähr so, als hätte gerade jemand die Verzweigung im Workflow erfunden. Sehenswert ist es trotzdem, weil es die beiden Operationen Evaluate und Route anschaulich im Einsatz zeigt. Und n8n sagt selbst ganz ehrlich, dass man bei einer sauberen Regel wie amount > 10000 besser beim normalen If-Node bleibt.
Vast-10M
Das Teil wird mit so viel Tamtam beworben, dass ich mich gleich mal auf die Warteliste eingetragen habe – da bin ich richtig gespannt.
Vast-10M bringt zehn Millionen Tokens Kontext, weil eine Million offenbar nicht mehr reicht. Möglich machen soll das „Voltropy Scalable Attention“ (VSA), eine neue Attention-Variante, die nicht in einem komplett neuen Modell trainiert, sondern laut Report ohne umfangreiches Nachtraining in bestehende Transformer eingebaut wird. Für Vast-10M nutzt Voltropy dafür DeepSeek V4 Flash, DeepSeek V4 Pro und GLM-5.2 als Basis, alle drei unter MIT-Lizenz. Alle drei Varianten sollen die vollen 10 Mio. Tokens ohne RAG oder ein externes Memory-System verarbeiten können. Für große Codebasen, umfangreiche Dokumentensammlungen oder lange Agent-Historien ist das zumindest konzeptionell interessanter als noch ein Modell mit ein paar mehr Benchmark-Prozenten.
Preise, Durchsatz, Hardware-Anforderungen sowie eine Veröffentlichung der Gewichte oder von VSA selbst nennt Voltropy bislang nicht. Der Technical Report ist eher ein sechsseitiger Nachweis der Long-Context-Eigenschaften als eine Architekturbeschreibung, und die Ergebnisse stammen ausschließlich von Voltropy selbst, gemessen auf einem einzigen Benchmark (BEAM). Lesenswert sind die Zahlen trotzdem: Das kleinste Modell, Vast-10M Flash, schlägt das größere Pro bei allen Kontextlängen und erreicht bei 10 Mio. Tokens mehr Punkte (40,2) als sein Basismodell bei 1 Mio. (39,7). Bei 100.000 und 500.000 Tokens liegen GPT-6 Astra und Claude Fable 5.1 allerdings noch klar vorn, erst ab einer Million zieht Flash mit GPT-6 Astra gleich und an Fable 5.1 vorbei. Spannende Technik also – aber bevor wir jetzt sämtliche RAG-Pipelines feierlich beerdigen, würde ich erst einmal abwarten, was zehn Millionen Tokens im echten Betrieb kosten.
| Technisches Merkmal | Vast-10M |
|---|---|
| Modellfamilie | Vast-10M Flash, Medium und Pro |
| Native Kontextlänge | 10 Mio. Tokens |
| Grundarchitektur | Transformer (Basismodelle: Mixture-of-Experts) |
| Neue Attention-Technik | Voltropy Scalable Attention (VSA) |
| Vast-10M Flash | basiert auf DeepSeek V4 Flash |
| Vast-10M Medium | basiert auf GLM-5.2 |
| Vast-10M Pro | basiert auf DeepSeek V4 Pro |
| Parameterzahl | nicht separat angegeben |
| Modalitäten | im Technical Report nicht näher spezifiziert |
| Benchmarks | ausschließlich BEAM, von Voltropy selbst gemessen |
| Gewichte veröffentlicht | bislang nicht angekündigt |
| Lizenz | nicht angegeben (Basismodelle: MIT) |
| API / Zugang | Warteliste, zunächst nur Vast-10M Flash als Early Access |
| Preis | noch nicht veröffentlicht |
| Throughput / Latenz | nicht veröffentlicht |
Das war’s für diese Woche – und passt wie immer auf eure Agenten auf.