> ## Content Index
> Fetch the complete content index at: https://t01.li/llms.txt
> Use this file to discover other available public pages before exploring further.

# AI Picks der 39. KW
- URL: https://t01.li/ai-shorts/ai-picks-der-39-kw/
- Published: 2026-09-25T09:38:56.000Z
- Updated: 2026-09-25T10:17:41.000Z
- Description: Opus 5.5 und GPT-6 Sol/Luna erscheinen am selben Tag und drücken die API-Preise. Dazu Grok 4.7, Xiaomis MiMo-V2.6 als Open Weights, eine Welle an Sprach- und TTS-Modellen, die nächste Irregular-Panne und Werkzeuge von AX bis OpenWiki.
- Author: Tobias Glawe
- Tags: AI Shorts

Nicht, dass sich das Thema Hardware totgelaufen hätte, aber bei den aktuellen Preisen für Speicher und GPUs suchen wohl gerade alle irgendwie nach dem goldenen Kalb. Dafür haben die Frontier Labs reingehauen – mit reichlich Gemeinsamkeiten. Ich werde das Gefühl nicht los, dass Amodei und Altman mindestens einmal die Woche telefonieren oder sich zum Mühle spielen treffen, oder so. *Opus 5.5* sowie *GPT-6 Sol* und *Luna* sind am selben Tag innerhalb weniger Stunden erschienen und drücken jeweils die API-Preise deutlich nach unten.

Ansonsten ganz viele Sprachmodelle und ein erneuter kleiner Unfall bei den Spezialexperten von Irregular. Dann haben SpaceXAI sowie Xiaomi noch abgeliefert – man kommt so langsam nicht mehr hinterher.

Begeben Sie sich in eine aufrechte Sitzposition und schnallen Sie sich bitte an, denn wir schauen zurück auf eine reichhaltige 39\. Kalenderwoche im Jahre 2026, cheers.

## Jev von TypeSafe

Das war etwas umfangreicher und ist daher [in einem eigenen Artikel](https://t01.li/ki-news/jev-typesafe-system-one-model-einordnung/) gelandet: *Jev* von TypeSafe ist kein klassisches LLM, sondern ein probabilistischer Entscheidungs-Layer. Statt Text erzeugt das Modell typisierte Wahrscheinlichkeiten für einen vorgegebenen Ergebnisraum. Das kann bei Agent-Gates, Klassifikation oder automatisierten Prüfungen interessant sein, weil Jev günstig und schnell arbeitet. Der vom Anbieter beworbene Vorteil gegenüber großen LLMs ist allerdings mit Vorsicht zu lesen, denn die Vergleichswerte stammen überwiegend aus eigenen [Evals](https://t01.li/glossar/#eval), und „typsicher“ bedeutet weder deterministisch noch automatisch richtig.

Der sinnvollste Einsatz liegt dort, wo unstrukturierter Text semantisch bewertet werden muss, die eigentliche Geschäftslogik aber weiterhin im Code bleibt.

Seit Dienstag ist auch mein Account freigeschaltet – schauen wir mal.

## Claude Opus 5.5

Anthropic hat [Claude Opus 5.5 veröffentlicht](https://t01.li/ki-news/claude-opus-5-5-fable-niveau-40-prozent-guenstiger/) – mit 1 Mio. Tokens Kontext, verpflichtendem Thinking und Preisen von 4 $ Input und 20 $ Output pro Million Tokens. Gegenüber Opus 5 sinken die regulären Tokenpreise damit um 20 Prozent, Cache Reads sogar um 60 Prozent auf 0,20 $. Anthropic spricht trotzdem von rund 40 Prozent geringeren Kosten bei typischen Aufgaben, weil *Opus 5.5* zusätzlich sparsamer mit Tokens umgehen soll. Artificial Analysis kommt bei Medium-Effort tatsächlich auf ziemlich genau diese Größenordnung.

Der kleine Haken an der Geschichte: [Effort](https://t01.li/glossar/#reasoning-effort) ist jetzt ziemlich wörtlich zu nehmen. Thinking lässt sich nicht mehr abschalten (das kennen wir ja schon [von GPT-6 Astra](https://t01.li/ki-news/gpt-6-astra-vs-gpt-5-6-sol/)), und zwischen Medium und Max liegen laut Artificial Analysis beim Preis pro Aufgabe Welten – für sieben zusätzliche Punkte steigt die Rechnung auf das Viereinhalbfache. Für mich ist deshalb weniger spannend, ob *Opus 5.5* irgendwo noch drei Benchmark-Punkte herausquetscht, sondern ob Medium im Alltag tatsächlich zum neuen Sweet Spot wird. Max kann man ja immer noch einschalten, wenn die Kreditkarte sich langweilt.

## GPT-6 Sol und Luna

OpenAI hat [GPT-6 Sol und Luna veröffentlicht](https://t01.li/ki-news/gpt-6-sol-luna-openai-halbiert-api-preise/) – das eigentlich Spannende daran ist aber eher die Preisliste. *Sol* kostet in der API 2 $ Input und 10 $ Output pro Million Tokens, *Luna* nur noch 0,10 beziehungsweise 0,50 $. Dazu kommen 90 Prozent Rabatt auf Cache-Reads und ein überarbeitetes Prompt-Caching, bei dem sich Reasoning-Effort und Tools während einer Konversation ändern lassen, ohne den bisherigen Cache gleich wegzuwerfen. Beide Modelle bieten rund 1 Mio. Tokens Kontext und bis zu 128.000 Output-Tokens; ein GPT-6 Terra bleibt diesmal aus.

Der große Generationssprung ist das auf dem Papier mal nicht so. Im Artificial-Analysis-Index bewegt sich Luna gegenüber GPT-5.6 gar nicht, Sol nur minimal – der sichtbare Sprung kam [schon mit Astra](https://t01.li/ki-news/gpt-6-astra-vs-gpt-5-6-sol/). Für Agenten und Pipelines kann das trotzdem interessanter sein als noch fünf Punkte auf irgendeinem [Benchmark](https://t01.li/glossar/#benchmark). Wenn das gleiche Zeug plötzlich ungefähr die Hälfte kostet und der Cache besser hält, lacht die Buchhaltung. Mein erster Kandidat für eigene Tests wäre deshalb ausgerechnet Luna: absurd billig und zumindest im Gesamtindex nicht schlechter als der Vorgänger.

## Getting the most out of Opus 5.5 in Claude and Claude Code

Anthropic hat [einen kleinen Praxisleitfaden für Opus 5.5](https://claude.dev/blog/getting-the-most-out-of-opus-5-5/?ref=t01.li) veröffentlicht und betont noch mal: „Think carefully“ und „think step by step“ können dann endlich doch mal raus. *Opus 5.5* denkt ohnehin vor jeder Antwort und entscheidet selbst über den Aufwand. Wichtiger ist laut Anthropic, dem Modell die komplette Aufgabe, ein klares „Done“ und konkrete Stop-Bedingungen mitzugeben. Für längere Runs in [Claude Code](https://t01.li/ai-dev/claude-code-auto-mode-default/) wird zudem empfohlen, Aufgabenlisten in Dateien zu halten (nein, nicht in der CLAUDE.md), größere Arbeiten auf Subagents aufzuteilen und in der CLAUDE.md explizit festzulegen, wann Claude weiterarbeiten und wann es fragen soll.

Das passt zu dem, was sich beim Arbeiten mit Agenten ohnehin abzeichnet: weniger Prompt-Magic, mehr saubere Auftragsdefinition und Zustandsmanagement. Interessant ist der Rat, Ergebnisse noch einmal vom Modell selbst gegen Diff oder Anforderungen prüfen und Unsicherheiten ausdrücklich markieren zu lassen. Letzteres halte ich persönlich schon länger so, da Claude bei komplexeren oder längeren Tasks gerne mal auffällt, dass es auf dem Weg noch eine Kleinigkeit „vergessen“ hat – trotz Plan Mode.

Und falls *Opus 5.5* bei einem Safety-Check auf ein älteres Modell umgeschaltet wird, sollte man das zumindest bemerken. Sonst optimiert man munter seinen Workflow für ein Modell, mit dem man gar nicht mehr arbeitet.

## Grok 4.7

SpaceXAI (an den Namen werde ich mich wohl nie gewöhnen) hat [Grok 4.7 abgeworfen](https://x.ai/news/grok-4-7?ref=t01.li) und schreibt über sein neues Spitzenmodell:

> Served at the same price and speed as Grok 4.6, it is highly competitive in its class.

Wie tief willst Du stapeln?  
Positioniert wird *Grok 4.7* [exakt wie der Vorgänger](https://t01.li/ai-shorts/ai-picks-der-33-kw/#grok-4-6) für Coding, agentische Aufgaben und allgemeine Wissensarbeit. Das LLM bietet 500.000 Tokens [Kontext](https://t01.li/glossar/#kontextfenster), akzeptiert Text und Bilder, und hinten raus kommt: Text. Reasoning lässt sich über [vier Stufen](https://docs.x.ai/developers/models/grok-4.7?ref=t01.li) von low bis xhigh steuern, dazu gibt es [Function Calling](https://t01.li/glossar/#tool-calling), [Structured Outputs](https://t01.li/glossar/#structured-output) sowie serverseitige Web- und X-Search-Tools. Wem das nicht schnell genug ist, für den serviert SpaceXAI eine Fast-Variante mit doppeltem Output-Tempo zum doppelten Preis.

[Artificial Analysis hat auch schon nachgemessen](https://artificialanalysis.ai/models/grok-4-7?ref=t01.li) und bescheinigt der xhigh-Stufe:

> Grok 4.7 (xhigh) is amongst the leading models in intelligence and reasonably priced when comparing to other models of similar price. It’s also notably slow and very verbose.

Die high-Stufe kommt [in der Messung](https://artificialanalysis.ai/models/releases/grok-4-7?ref=t01.li) auf denselben Index-Wert, ist aber flotter unterwegs und wird nur noch als „slower than average“ geführt. Also kurz: eigentlich ganz okay, recht günstig, aber auf „xhigh“ langsam und ’ne Labertasche.

Btw: Anders als bei den anderen großen US-Labs kommt das Thema Token-Effizienz im Launch-Post gar nicht auf den Tisch.

| Technisches Merkmal              | Grok 4.7                                                             |
| -------------------------------- | -------------------------------------------------------------------- |
| **Kontextfenster**               | 500.000 Tokens                                                       |
| **Input-Modalitäten**            | Text, Bild                                                           |
| **Output-Modalität**             | Text                                                                 |
| **Knowledge Cutoff**             | Mai 2026                                                             |
| **Reasoning-Stufen**             | low, medium, high (Default), xhigh                                   |
| **Inputpreis bis 200k Kontext**  | 2,00 $ / 1 Mio. Tokens                                               |
| **Cached Input bis 200k**        | 0,50 $ / 1 Mio. Tokens                                               |
| **Outputpreis bis 200k**         | 6,00 $ / 1 Mio. Tokens                                               |
| **Inputpreis über 200k Kontext** | 4,00 $ / 1 Mio. Tokens                                               |
| **Cached Input über 200k**       | 1,00 $ / 1 Mio. Tokens                                               |
| **Outputpreis über 200k**        | 12,00 $ / 1 Mio. Tokens                                              |
| **Weitere Zugänge**              | SpaceXAI-API, Cursor, Grok Build, Model-Router und Cloud-Plattformen |

Ein größerer Haken bei den Preisen ist etwas versteckt: Die oft genannten 2 / 6 $ pro Million Tokens gelten nur bis 200.000 Prompt-Tokens. Oberhalb dieser Schwelle verdoppeln sich Input-, Cache- und Outputpreise – das Muster kennt man schon von *Grok 4.6*.

## MiMo-V2.6

Nächstes LLM, andere Bude: Xiaomi hat am 21\. September die [MiMo-V2.6-Familie](https://mimo.xiaomi.com/mimo-v2-6?ref=t01.li) veröffentlicht, und das gleich mit drei Vertretern: *mimo-v2.6-pro*, *mimo-v2.6-flash* und *mimo-v2.6-pro-ultraspeed*. Bis auf die UltraSpeed-Variante liegen alle als [Open Weights](https://t01.li/glossar/#open-weights) unter MIT-Lizenz [auf Hugging Face](https://huggingface.co/collections/XiaomiMiMo/mimo-v26?ref=t01.li) – Pro mit 1,02 Billionen Gesamtparametern, Flash mit 309 Milliarden, dazu ein auf Qwen3.5-9B destilliertes Einsteigermodell.

Sie gehen mit dem allgemeinen Trend: starke Ausrichtung auf agentische Workloads inklusive Tool Calling, Computer Use, längerer Tool-Traces und Multi-Agent-Szenarien. Xiaomi erwähnt ausdrücklich, dass genau das Bestandteil des Trainings ist – ein gemischter RL-Lauf über mehr als 7.000 Umgebungen quer durch Coding, Agenten, Visual und Cybersecurity.

Was haben wir denn da so:

| Merkmal                              | MiMo-V2.6 Pro             | MiMo-V2.6 Flash           |
| ------------------------------------ | ------------------------- | ------------------------- |
| **Architektur**                      | Sparse Mixture-of-Experts | Sparse Mixture-of-Experts |
| **Parameter**                        | 1,02 T                    | 309 B                     |
| **Aktive Parameter**                 | 42 B                      | 15 B                      |
| **Kontextfenster**                   | 1 Mio. Tokens             | 1 Mio. Tokens             |
| **Modalitäten**                      | Text, Bild, Video, Audio  | Text, Bild, Video, Audio  |
| **MoE Experts**                      | 384                       | 256                       |
| **Aktive Experts pro Token**         | 8                         | 8                         |
| **Native Tool-/Agent-Unterstützung** | ja                        | ja                        |
| **Computer Use / GUI-Verarbeitung**  | ja                        | ja                        |
| **Lizenz**                           | MIT                       | MIT                       |
| **API-Zugriff**                      | MiMo API, OpenRouter      | MiMo API, OpenRouter      |
| **API-Modellname**                   | mimo-v2.6-pro             | mimo-v2.6-flash           |
| **UltraSpeed-Variante**              | mimo-v2.6-pro-ultraspeed  | –                         |

Die Unterschiede zwischen Pro und Flash liegen primär in der Größe. Pro nutzt eine [MoE-Architektur](https://t01.li/glossar/#moe) mit 1,02 Billionen Gesamtparametern und 42 Milliarden aktivierten Parametern, Flash kommt auf 309 Milliarden bzw. 15 Milliarden aktive Parameter. Beide verwenden denselben multimodalen Encoder-Unterbau sowie einen zusätzlichen Multi-Token-Prediction-Decoder für Speculative Decoding. Für Self-Hosting nennt Xiaomi primär SGLang und vLLM; erreichbar sind die Modelle außerdem über die [MiMo-API](https://mimo.mi.com/docs/en-US/news/latest/v2-6?ref=t01.li), MiMo Desktop und OpenRouter.

Die Preise bleiben laut Xiaomi auf dem Niveau des Vorgängers:

| Modell              | Input, Cache Hit | Input, Cache Miss | Output |
| ------------------- | ---------------- | ----------------- | ------ |
| **MiMo-V2.6 Pro**   | 0,0036 $         | 0,435 $           | 0,87 $ |
| **MiMo-V2.6 Flash** | 0,0028 $         | 0,14 $            | 0,28 $ |

## Space Bunny Alpha

Eine neue Woche, ein neues Stealth-Modell auf OpenRouter: [Space Bunny Alpha](https://openrouter.ai/stealth/space-bunny-alpha?ref=t01.li) ist seit dem 23\. September verfügbar.

Was wir sonst so haben: 1 Mio. Tokens Kontext, bis zu 524.288 Output-Tokens, multimodaler Input und einstellbarer Reasoning-Aufwand. OpenRouter beschreibt es als schnelles Modell mit Schwerpunkt Coding und agentischen Workflows. Der Zugang ist wie immer während der Preview kostenlos – Parameterzahl, Architektur und Trainingsdetails gibt es passend zum Namen erst einmal nur im Kaninchenbau.

## Gemini 3.8 Flash TTS und Gemini 3.8 Flash-Lite TTS

Google und Sprachmodelle, das wird gerade ein größeres Thema: [Flash TTS](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/?ref=t01.li) kann neue Stimmen per Prompt erzeugen, Rolle, Akzent und Stimmcharakter über mehr als 100 Sprachen und Dialekte steuern und Dialoge Zeile für Zeile mit Tempo, Emotion, Pausen oder Einwürfen wie Lachen und Seufzen dirigieren. Obendrauf gibt es mehr als 2.000 vorgefertigte Stimmen, Zwei-Sprecher-Szenen und laut Google stabilere Langform-Ausgabe für Podcasts oder Hörbücher. *Flash-Lite* ist die günstigere Variante für Volumen, etwa Dubbing oder Voice Agents.

So richtig interessant ist aber die Voice Replication: Aus 30 Sekunden Referenzaudio kann *3.8 Flash TTS* ein konsistentes Stimmprofil erzeugen – allerdings nur mit zusätzlicher Einwilligungsaufnahme des Sprechers. Generiertes Audio bekommt SynthID- und C2PA-Metadaten. Der kleine Haken für hiesige Ohren: Genau diese Voice-Replication-Funktion ist in AI Studio derzeit nicht im EWR, in UK und der Schweiz verfügbar – übrigens auch nicht in Illinois, Texas und Indien, Biometrie-Gesetze lassen grüßen. Die eigentlichen TTS-Modelle starten dagegen direkt über Gemini API und AI Studio.

## Qwen-Audio-3.1-TTS

*Qwen-Audio-3.1-TTS* kombiniert einen 12,5-Hz-Speech-Tokenizer mit einem mehrstufigen Training aus Language Model und Flow Matching – die Grundlagen dazu stehen im [Technical Report zur Version 3.0](https://arxiv.org/abs/2607.23938?ref=t01.li). Das Modell unterstützt 16 Sprachen plus 20 chinesische Dialektregionen, Voice Cloning auch über Sprachgrenzen hinweg, natürlichsprachliche Anweisungen für Stimme, Tempo und Emotion sowie 86 Inline-Tags – vom Lachen über Atemgeräusche bis zum Seufzer. Längere Texte entstehen in einem Durchlauf mit bis zu drei Minuten Audio; wer 48 kHz und längere Podcast-Formate braucht, greift zur Schwester-Variante [qwen-audio-3.1-tts-next](https://docs.modelstudio.console.alibabacloud.com/en/model-studio/qwen-audio-3-1-tts-next?ref=t01.li).

Viel spannender als das nächste „klingt fast wie ein Mensch“ finde ich die Kontrollmöglichkeiten dahinter. Stilwechsel lassen sich über die Tags gezielt innerhalb eines Textes setzen, und selbst verrauschte oder hallige Referenzaufnahmen sollen ohne separaten Denoising-Schritt funktionieren. Das bringt TTS langsam von „lies mir diesen Text vor“ in Richtung tatsächlich steuerbarer Audioproduktion.

## NVIDIA Nemotron 3 Diarization

Die Woche der Sprachmodelle: NVIDIA hat mit [Nemotron 3 Diarization](https://huggingface.co/blog/nvidia/nemotron-diarization?ref=t01.li) ein offenes 100-Millionen-Parameter-Modell für Speaker Diarization veröffentlicht – also für die Frage, wer wann spricht. Das Modell verarbeitet Live- und aufgezeichnetes Audio, erkennt überlappende Sprecher und unterstützt bis zu acht Personen. Ein einzelner Checkpoint lässt sich offline wie im Streaming einsetzen; NVIDIA empfiehlt dafür Latenzstufen von 30,4 Sekunden bis hinunter zu 0,32 Sekunden Input-Puffer. Die Ausgabe besteht aus Zeitstempeln und anonymen Speaker-IDs – speaker\_1 bleibt also speaker\_1 und wird nicht automatisch zu „Larissa“ oder „Karl“.

Nemotron transkribiert dabei selbst nichts und identifiziert auch keine Personen, sondern liefert die Sprecherstruktur, auf der ASR oder Agenten anschließend aufsetzen. [Die Weights](https://huggingface.co/nvidia/Nemotron-3-Diarization?ref=t01.li) sind offen, laufen über NeMo und dürfen unter OpenMDW 1.1 auch kommerziell eingesetzt werden. Nicht der Glamour-Job unter den KI-Aufgaben – aber vermutlich einer von denen, die eine Sprachpipeline erst wirklich brauchbar machen.

## Google confirms Gemini models hacked three companies in May 2026

Google so: Was Anthropic und OpenAI können, können wir doch schon lange! Ergebnis: Gemini hat bei einem Sicherheitstest im Mai drei reale Unternehmen kompromittiert – allerdings [weniger spektakulär, als die Schlagzeile von Ars Technica](https://arstechnica.com/google/2026/09/google-confirms-gemini-models-hacked-three-companies-in-may-2026/?ref=t01.li) vermuten lässt. Die Modelle sollten in einer abgeschotteten Capture-the-Flag-Umgebung arbeiten, bekamen durch eine Fehlkonfiguration beim Testanbieter Irregular aber Zugriff aufs offene Internet. Weil ein fiktives Testunternehmen denselben Namen wie eine reale Firma trug, landete Gemini auf echten Systemen: einmal per Passwort-Raten, in den anderen Fällen über Zugangsdaten, die öffentlich in Repositories lagen. Als die Modelle erkannten, dass sie nicht mehr in der Simulation arbeiteten, stoppten sie.

Entschuldigung, das hatte ich im Fall von Irregular [schon einmal gefragt](https://t01.li/ai-shorts/ai-picks-der-32-kw/#openai-modelle-brechen-bei-cyber-evaluierungen-aus-testumgebungen-aus), aber was machen die da eigentlich so beruflich? So langsam kann mir niemand mehr erzählen, dass dies nicht beabsichtigt war: „Dummerweise haben wir da mal eine *hust* ‚Fehlkonfiguration‘ eingebaut und das war natürlich *hust* ein Versehen. Na ja, kann man nichts machen.“

## Priorities and principles for effective third party assessments

OpenAI will [externe Sicherheitsprüfungen stärker formalisieren](https://openai.com/index/priorities-principles-third-party-assessments/?ref=t01.li) und nennt dafür vier Schwerpunkte: Safety Cases, konkrete Schutzmechanismen, Capability-Evals für Cyber-, Bio-/Chemie- und Self-Improvement-Risiken sowie unabhängige Untersuchungen bei kritischen Misalignment-Vorfällen. Externe Prüfer sollen dafür je nach Fall tiefen Zugriff auf interne Systeme, Safeguards und Evaluationsdaten erhalten – einschließlich Grey-Box-Tests und in bestimmten Szenarien sogar Chain-of-Thought-Zugriff.

Nach dem, [was die letzten Monate so los war](https://t01.li/ai-shorts/ai-picks-der-30-kw/#openai-modell-bricht-aus-sandbox-aus), ist der Schritt nachvollziehbar.

## Don’t be fooled by this summer of AI hype

Timnit Gebru und Emily Bender haben sich [den KI-Hype dieses Sommers vorgenommen](https://www.technologyreview.com/2026/09/22/1144867/?ref=t01.li). Ihr Punkt: Bei angeblichen Durchbrüchen in Cybersecurity, Mathematik oder selbstverbessernder KI folgt oft dasselbe Muster – große Ankündigung, große Schlagzeilen, und erst danach schauen Fachleute genauer hin. Bei mehreren der untersuchten Fälle fiel das Ergebnis anschließend deutlich unspektakulärer aus. Besonders problematisch wird es, wenn aus einem Sicherheitsproblem plötzlich eine Geschichte über einen „autonomen“ Agenten wird oder aus einem interessanten mathematischen Ergebnis gleich der nächste Forschungsdurchbruch.

Kleiner Seitenhieb sei erlaubt: Gebru und Bender gehören seit Jahren zu den deutlichsten Kritikerinnen der LLM-Industrie. Der Grundtenor ist aber trotzdem brauchbar – Pressemitteilung lesen, zwei Tage warten und dann die externe Expertise lesen. Gerade bei AI ist zwischen „das Modell hat etwas Interessantes gemacht“ und „wir haben soeben die nächste Stufe der Intelligenz erreicht“ reichlich Luft. Und reichlich Marketingbudget.

## AX

Google hat da mal was gebastelt: [einen Open-Source-Orchestrator für Agenten](https://agentexecutor.io/?ref=t01.li) – grob gesagt Kubernetes für agentische Workloads. Statt einfach nur einen Agentenprozess zu starten, definiert AX vier Bausteine: Task für die isolierte Ausführung, Workspace für Repositories, MCP-Server und Skills, Gateway für Netzwerkregeln und Model für LLM-Konfiguration und Credentials. Agenten laufen in Sandboxes, lassen sich per ssh inspizieren, pausieren und später mit erhaltenem Zustand wieder fortsetzen. [Das Ganze](https://github.com/google/ax?ref=t01.li) läuft auf Kubernetes und Googles ebenfalls offenem Agent Substrate.

AX behandelt Agenten tatsächlich als eigene Infrastruktur-Workload – zustandsbehaftet, lange laufend, zwischendurch minutenlang untätig und mit potenziell unangenehm viel Zugriff auf Netzwerk und Tools. Wer also schon immer mal dachte, seinem Agent-Stack fehle vor allem noch ein bisschen Kubernetes-Komplexität – et voilà! Aber Achtung: alles aktuell noch v1alpha1.

## OpenChamber 2.0

[OpenChamber 2.0](https://openchamber.dev/blog/opencode-v2/?ref=t01.li) zieht auf OpenCode 2 um und beseitigt damit eine lästige Klasse von Problemen. Skills, Agents, Commands, opencode.json, MCP-Server und Plugins werden jetzt während der laufenden Session neu geladen; ein kompletter Neustart ist meist nicht mehr nötig. Gleichzeitig wird OpenCode deutlich plugin-zentrierter: Plugins können inzwischen Agents, Tools, Modelle, Provider, MCP-Server oder Websuche erweitern und sogar eigene API-Methoden bereitstellen. Kleine Fußangel für bestehende Setups: CLAUDE.md wird von OpenCode 2 nicht mehr automatisch geladen, Projektregeln gehören jetzt in die AGENTS.md.

Spannend ist der Code Mode. Statt dem Modell dutzende einzelne Toolbeschreibungen in den Kontext zu kippen und jeden [MCP](https://t01.li/glossar/#mcp)\-Call nacheinander fahren zu lassen, bekommt es ein Script-Tool und kann darin freigegebene MCP- und Plugin-Funktionen direkt kombinieren. Das spart Kontext und Roundtrips und dürfte gerade bei tool-lastigen Agenten schnell relevant werden. Der Haken daran ist wenig überraschend: Kleinere Modelle sind beim Schreiben dieser Skripte spürbar weniger zuverlässig.

## OpenWiki v0.6.0

![OpenWiki Logo mit Verlinkungs-Symbol](https://t01.li/content/images/2026/09/openwiki-link.webp)

OpenWiki Funktionsschema

Auch bei OpenWiki tut sich etwas, denn mit der [jüngsten v0.6.0](https://github.com/langchain-ai/openwiki/releases/tag/v0.6.0?ref=t01.li) vom 23\. September kommen Integrationen für Antigravity und [Oh My Pi](https://omp.sh/?ref=t01.li) als Coding-Agenten dazu. Wikis lassen sich jetzt untereinander verlinken und für Multi-Wiki-Reads kombinieren, per MCP werden sie abfragbar, und Page Worker laufen auf Wunsch parallel.

## Claude Cloud Sessions nun offiziell verfügbar

Cloud Sessions haben die Research Preview verlassen. Sie laufen in der Anthropic-Infrastruktur, sodass Tasks außerhalb der eigenen Umgebung weiterlaufen, auch wenn der Laptop längst zugeklappt ist. Nutzbar ist das über [claude.ai/code](https://claude.ai/code?ref=t01.li), den Code-Tab in der Claude-Mobile-App, über die Desktop-App oder mit `claude --cloud` im CLI.

Voraussetzung ist ein Pro- oder Max-Plan. Anthropic [spendiert Bestandskunden zum Einstieg](https://claude.ai/code/claim-credit/10?ref=t01.li) je nach Tier 100 bzw. 250 $ Guthaben als Einmalkredit. Abholen muss man sich den bis zum 7\. Oktober, nicht verbrauchtes Guthaben verfällt am 4\. November.

## Claude Marketplace

Ab sofort bündelt der [Claude Marketplace](https://claude.com/platform/marketplace?ref=t01.li) Konnektoren, Plugins, Agenten, Produkte und Beratungspartner an einem Ort. Technisch bleibt Anthropic [bei seiner bisherigen Linie](https://claude.com/blog/claude-marketplace?ref=t01.li): Konnektoren und Plugins setzen auf MCP und Agent Skills auf, daneben listet der Marketplace fertige Claude-basierte Produkte, z. B. von Cursor, CrowdStrike, Harvey oder Snowflake.

## SEOntology: Giving SEO a Shared Language for the Age of AI Agents

[SEOntology](https://wordlift.io/blog/en/seontology-shared-language-ai-agents/?ref=t01.li) möchte SEO-Daten eine gemeinsame, maschinenlesbare Sprache geben, damit Agenten nicht Rankings aus Tool A, interne Links aus Tool B und Search-Console-Daten aus Tool C irgendwie selbst zusammenschrauben müssen. Die Open-Source-Ontologie erweitert Schema.org und modelliert unter anderem Seiten, Queries, Links, Qualitätssignale und Agent-Aktionen. Das zugehörige Paper wurde auf der SEMANTiCS 2026 als Best Student Paper ausgezeichnet; getestet wurde das Modell anhand von 47 Praxisfragen und anschließend über sechs Monate bei 1.233 realen SEO-Aufgaben.

WordLift berichtet von rund 30 Prozent weniger manueller Arbeit, bei einigen stark standardisierten Recherche- und Audit-Aufgaben deutlich mehr. Das sind allerdings Effizienzwerte aus einem System, an dessen Entwicklung WordLift selbst beteiligt ist – keine Aussage darüber, dass deshalb Rankings oder KI-Sichtbarkeit steigen. Semantik hilft dem Agenten beim Denken. Google und Co. müssen davon noch lange nicht beeindruckt sein.

Vielleicht findet ja bis nächste Woche noch jemand das goldene Kalb. Neues Blech zu halbwegs bezahlbaren Preisen wäre ja schon mal ein Anfang.