> ## Content Index
> Fetch the complete content index at: https://t01.li/llms.txt
> Use this file to discover other available public pages before exploring further.

# Gemini 4 Argon: Googles Comeback ins Spitzenfeld – mit Gästeliste
- URL: https://t01.li/ki-news/gemini-4-argon-benchmarks-preis-zugang/
- Published: 2026-10-01T08:14:55.000Z
- Updated: 2026-10-01T08:15:05.000Z
- Description: Googles neues Spitzenmodell Gemini 4 Argon schreibt bis zu 1 Mio. Tokens und glänzt in Herstellerbenchmarks. Nutzen dürfen es vorerst nur Cyber-Verteidiger, und laut Bloomberg zweifeln Google-Mitarbeitende am Frontend-Coding. Eine Einordnung der Papierlage.
- Author: Tobias Glawe
- Tags: KI News

Google hat am 30\. September [*Gemini 4 Argon* vorgestellt](https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/?ref=t01.li), das erste Modell der Gemini-4-Generation und das erste neue Flaggschiff seit *Gemini 3.1 Pro* im Februar. Dazwischen lagen ein auf der I/O angekündigtes und später [gestrichenes *Gemini 3.5 Pro*](https://9to5google.com/2026/09/30/gemini-4-argon-announcement/?ref=t01.li) sowie eine ganze Serie von Flash-Modellen, zuletzt [*Gemini 3.8 Flash*](https://t01.li/ki-news/gemini-3-8-flash/). Mit *Argon* will Google zurück ins Spitzenfeld, und auf dem Papier gelingt das auch.

Nutzen kann das Modell allerdings fast niemand. Zum Start bekommt *Argon* nur ein ausgewählter Kreis von „Cyber-Verteidigern“ (sorry, für die Anführungszeichen), alle anderen warten vor der Tür. Ausprobiert habe ich also nichts, das hier ist eine Einordnung der Papierlage. Die großen Gemini-Modelle stecken bei mir allerdings auch aktuell in keiner Pipeline und in keinem Workflow. Ich nutze sie im Chat für Recherche, Analysen und Dokumente, am liebsten in Markdown – genau das hatte *Gemini 3.1 Pro* gut drauf.

## TL;DR 

*Gemini 4 Argon* ist Googles neues Spitzenmodell mit bis zu 1 Mio. Output-Tokens und starken Herstellerwerten. Nutzen dürfen es vorerst nur ausgewählte Cyber-Verteidiger im Fairwind Program.

- Einführungspreis 2 $ / 10 $ pro 1 Mio. Tokens, danach 4 $ / 20 $ – ein Enddatum für die Aktion nennt Google nicht.
- In Googles eigener Tabelle liegt *Argon* in 13 von 19 Zeilen allein vorn, beim agentischen Coding auf Terminal-Bench 4.0 und FrontierSWE v2 aber hinten.
- Artificial Analysis misst 53 Punkte im Intelligence Index, gleichauf mit *GPT-6 Astra* und hinter *Claude Opus 5.5*.
- Laut Bloomberg zweifeln einige Google-Mitarbeitende an der Praxisleistung bei bestimmten Coding-Aufgaben, darunter Frontend-Design.

## Wer Gemini 4 Argon bekommt und wer nicht

Den Anfang machen Partner aus Googles [Fairwind Program](https://deepmind.google/fairwind-program/?ref=t01.li), das Anfang September zusammen mit *Gemini 3.8 Flash Cyber* gestartet ist und laut Google mehr als 650 Organisationen umfasst – vor allem Behörden, Betreiber kritischer Infrastruktur und zentrale Technologieplattformen. Ein Teil davon bekommt *Argon* ohne Cyber-[Guardrails](https://t01.li/glossar/#guardrails), um Schwachstellen zu finden und zu patchen, bevor es jemand anderes tut. Parallel läuft das freiwillige Pre-Release-Verfahren der US-Regierung.

Die breitere Verfügbarkeit für Entwickler, Unternehmen und Endkunden soll laut Google mit zahlenden API-Kunden und Abonnenten von *Google AI Ultra* beginnen. Einen Termin nennt Google nicht. Eine öffentliche Model-ID in der Gemini API gibt es laut [The Rundown](https://www.therundown.ai/tools/gemini-4-argon?ref=t01.li) noch nicht, und zur Gemini-App in den kleineren Abos sagt die Ankündigung nichts.

Damit hakt es bei meinem Plan. Ich würde *Gemini* in *Antigravity* gern mal auf ein paar einfache Tasks loslassen, zum Beispiel eine Handvoll Landingpages nach Corporate Design Vorgaen (und alles schon fix und fertig als Skill). In Googles Ankündigung taucht *Antigravity* nicht auf, gelaufen ist *Argon* dort trotzdem schon. Im [Coding Agent Index von Artificial Analysis](https://artificialanalysis.ai/agents/coding-agents?ref=t01.li) kommt das Gespann aus *Antigravity CLI* und *Argon* auf 64 Punkte und Platz drei, hinter *Claude Code* mit *Sonnet 5.5* (68) und *Opus 5.5* (66), aber vor *Codex* mit *GPT-6 Astra* (62). Gemessen wird dort immer Modell plus [Harness](https://t01.li/glossar/#harness), also genau die Kombination, die ich gern testen würde.

## Eine Million Output-Tokens

Google hebt das Output-Limit von 64.000 auf eine Million Tokens an. [Artificial Analysis](https://artificialanalysis.ai/models/gemini-4-argon?ref=t01.li) führt *Argon* zusätzlich mit einem [Kontextfenster](https://t01.li/glossar/#kontextfenster) von einer Million Tokens, ein separates Input-Limit nennt Google zum Launch allerdings nicht. Damit lange Antworten nicht ins Timeout laufen, gibt es in der Gemini API eine neue Funktion namens Long Decode Continuation, die eine Antwort unterbricht und über Folgeanfragen fortsetzt.

Im Chat merkt man davon wenig. Für Agenten, die eine Codebasis migrieren oder einen langen Vertragsentwurf schreiben, fällt dagegen eine Grenze weg, an der Arbeit bisher abbrach oder in Häppchen zerlegt werden musste. Google liefert die Beispiele aus dem eigenen Haus. *Argon*\-Agenten migrieren C- und C++-Code nach Rust, beim Zircon-Kernel von Fuchsia geht es um mehr als 800.000 Zeilen, und ein Team solcher Agenten soll in Googles Rechenzentren Speicheroptimierungen gefunden und umgesetzt haben, die über 300 TiB Arbeitsspeicher freisetzen. Unabhängig prüfen lässt sich davon nichts. Die Rust-Umbauten laufen laut Google vor dem Produktiveinsatz außerdem noch durch Audits und Reviews.

Der Haken tauch dann auf der Preisliste auf: Jedes Output-Token kostet zum Einführungspreis 10 $ pro Million, danach 20 $ – eine einzige voll ausgereizte Antwort schlägt also allein beim Output mit 10 bzw. 20 $ zu Buche. Sparsam ist *Argon* auch sonst nicht, denn laut Artificial Analysis erzeugt das Modell im Schnitt 62.000 Output-Tokens pro Index-Aufgabe, *GPT-6 Astra* kommt mit 27.000 aus.

## Hersteller-Sternchen bei 13 von 19

Im Fließtext des Blogposts nennt Google nur Benchmarks, in denen *Argon* vorn liegt. Die vollständige Vergleichstabelle gegen *GPT-6 Astra*, *Claude Fable 5.1* und [*Claude Opus 5.5*](https://t01.li/ki-news/claude-opus-5-5-fable-niveau-40-prozent-guenstiger/) steckt als Grafik im Blogpost und im [Launch-Post von Google DeepMind auf X](https://x.com/GoogleDeepMind/status/2105388084154056939?ref=t01.li). Von ihren 19 Zeilen gewinnt *Argon* 13 allein und teilt sich bei einer weiteren den ersten Platz. [VentureBeat](https://venturebeat.com/technology/google-unveils-gemini-4-argon-retaking-benchmark-lead-over-openai-and-anthropic-but-in-limited-release?ref=t01.li) zählt die beiden GraphWalks-Zeilen als einen [Benchmark](https://t01.li/glossar/#benchmark) und kommt deshalb auf 12 von 18\. Die Highlights aus Googles Sicht:

- DeepSWE v1.1 (lange Software-Engineering-Aufgaben): 77,9 %, vor *Opus 5.5* mit 74,2 % und *Astra* mit 74,1 %
- AutomationBench von Zapier (durchgängige Abläufe in typischen Geschäftsbereichen): 51,3 %, die Konkurrenz liegt zwischen 31,4 und 42,5 %
- Harvey’s Legal Agent Benchmark (juristische Recherche und Entwürfe): 19,6 %, alle anderen unter 7 %
- LVBench (Verständnis langer Videos): 91,7 %, vor *Astra* mit 87,5 %
- CWE-bench v1 (Schwachstellen beheben): 68 %, gleichauf mit *Astra*, *Opus 5.5* einen Punkt dahinter

Die schwächeren Zeilen stehen nur in der Tabellengrafik, und [heise hat sie herausgesucht](https://www.heise.de/news/Googles-Gemini-4-Argon-legt-Fokus-auf-Cybersicherheit-11471944.html?ref=t01.li). Auf Terminal-Bench 4.0 für agentisches Coding landet *Argon* mit 57,4 % hinter allen Konkurrenten aus Googles eigener Tabelle, *Claude Opus 5.5* kommt auf 66,4 %. Nimmt man [*Claude Sonnet 5.5*](https://t01.li/ki-news/claude-sonnet-5-5-benchmarks-preis-agenten/) mit Anthropics Angabe von 70,6 % dazu, liegt ausgerechnet das Modell mehr als 13 Punkte vorn, das so viel kostet wie *Argon* zum Einführungspreis. Auf FrontierSWE v2 hat *GPT-6 Astra* laut [MarkTechPost](https://www.marktechpost.com/2026/09/30/google-deepmind-unveils-gemini-4-argon-with-1m-output-tokens-for-coding-knowledge-work-and-cyber-defense/?ref=t01.li) gut zehn Punkte Vorsprung.

Das ist Googles eigene Vergleichsauswahl, eine Mischung aus eigenen Runs und Ergebnissen externer Benchmark-Betreiber. Auswahl und Präsentation stammen aber trotzdem vom Hersteller, die Brille muss man sich eben dabei aufsetzen.

### Was von außen gemessen wurde

Trotz des geschlossenen Zugangs gibt es bereits unabhängige Zahlen. [Artificial Analysis](https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs?ref=t01.li) kommt im Intelligence Index auf 53 Punkte bei [Reasoning Effort](https://t01.li/glossar/#reasoning-effort) High, gleichauf mit *GPT-6 Astra* und laut [The Decoder](https://the-decoder.com/google-gemini-4-argon-closes-the-gap-with-openai-and-anthropic-but-doesnt-take-a-clear-lead/?ref=t01.li) auch mit *Claude Fable 5.1*. Vorn bleiben *Claude Opus 5.5* mit 58 und *Claude Sonnet 5.5* mit 56 Punkten. Beim Einführungspreis kostet *Argon* mit 1,99 $ pro Index-Task rund 61 % von *Astra* mit 3,26 $. Nach Ende der Aktion kalkuliert Artificial Analysis mit 3,98 $, dann wäre *Argon* bei gleicher Messung sogar teurer. Gemeint ist jeweils ein gewichteter Durchschnitt über die Eval-Aufgaben, kein allgemeiner API-Preis.

Für Recherche zählt eine andere Zahl aber mehr: Im AA-Omniscience-Test lag die [Halluzinationsrate](https://t01.li/glossar/#halluzination) bei 15 %, der niedrigste Wert unter allen Modellen mit mindestens 45 Index-Punkten (*GPT-6 Astra*: 51 %). Der Preis dafür steht laut The Decoder denn aber eine Zeile tiefer, denn richtig beantwortet hat *Argon* nur 50 % der Fragen, fünf Punkte weniger als *Gemini 3.1 Pro Preview*. Das Modell passt also öfter, statt zu raten – für Recherche ist mir das aber einhundertmal lieber als umgekehrt.

Auf dem [Vals Index](https://www.vals.ai/models/google%5Fgemini-4-argon?ref=t01.li), der Aufgaben aus Finanzen, Recht, Steuern und Coding bündelt, steht *Argon* mit 68,9 % auf Platz eins von 41 Modellen – laut [Vals AI auf X](https://x.com/ValsAI/status/2105388446844072033?ref=t01.li) zum ersten Mal ein Gemini-Modell. In der Text Arena von [Arena.ai](https://x.com/arena/status/2105394855644139908?ref=t01.li) führt *Argon* mit 1.525 Punkten, in der Code Arena für Webentwicklung reicht es nur für Platz acht (Stand jeweils 1\. Oktober 2026).

## Benchmarks top, Frontend wackelig?

Am Launch-Tag kam die Gegengeschichte von Bloomberg. Einige Google-Mitarbeitende mit direktem Zugang zu *Gemini 4* sagen demnach, das Modell schneide bei echter Arbeit schwächer ab als in Benchmarks und kämpfe mit bestimmten Coding-Aufgaben. Als Beispiel nannte eine Person laut [Implicator](https://www.implicator.ai/google-gemini-4-argon-staff-doubt-coding/?ref=t01.li) Frontend-Design, also den Teil, der bestimmt, wie eine App oder Website aussieht und sich anfühlt. Google hält es laut der [Zusammenfassung bei Investing.com](https://www.investing.com/news/stock-market-news/alphabet-stock-slips-on-report-of-internal-doubts-over-gemini-4-4925797?ref=t01.li) für falsch, *Gemini 4* beim Coding als schwach darzustellen, und ein Mitarbeiter spricht von einem „großen Konsens“, dass das Modell an der Frontier liegt.

Von außen lässt sich das nicht entscheiden. Platz acht in der WebDev-Arena, wo Menschen blind zwischen zwei Ergebnissen abstimmen, ist zumindest konsistent mit der Frontend-Kritik, bestätigt sie aber nicht. Dagegen steht [Vibe Code Bench](https://arxiv.org/abs/2603.04601?ref=t01.li), ein Test, in dem Modelle komplette Webanwendungen bauen. Vals hat *Argon* dort selbst gemessen und kommt in Version 1.1 auf 91,9 % und [Platz zwei von 106](https://www.vals.ai/models/google%5Fgemini-4-argon?ref=t01.li), knapp hinter *Claude Sonnet 5.5* mit 92,4 %.

## Prompt Injection, die Zahl für Pipelines

Bevor *Argon* breit verfügbar wird, will Google die Schutzmaßnahmen in vier Bereichen nachschärfen, nämlich bei Missbrauch für Cyber- und CBRN-Angriffe, indirekter Prompt Injection, Fehlausrichtung des Modells und abgeschotteten Testumgebungen. Gegen Fehlausrichtung überwacht Google die Chain-of-Thought und die Aktionen des Modells und bricht bei Bedarf ab.

Wer Modelle fremde Inhalte lesen lässt, sollte sich eine Zahl daraus merken. Auf Gray Swans Benchmark für indirekte [Prompt Injection](https://t01.li/glossar/#prompt-injection) liegt die von Google [veröffentlichte](https://deepmind.google/fairwind-program/?ref=t01.li) Attack Success Rate bei 15 Versuchen für *Argon* bei 0,7 %, für *Claude Opus 5.5* bei 1,0 % und für *GPT-6 Astra* bei 8,5 %. Konfidenzangaben fehlen, der Abstand zwischen 0,7 und 1,0 % ist also mit Vorsicht zu genießen. Für meine Chat-Nutzung spielt die Zahl kaum eine Rolle, für jeden Agenten mit Browser- oder Mailzugriff eine große.

## Günstig, solange die Aktion läuft

Zum Start kostet *Argon* 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, cached Input bekommt 95 % Rabatt. Das entspricht dem Tokenpreis von *Claude Sonnet 5.5* und [*GPT-6.1 Sol*](https://t01.li/ki-news/gpt-6-1-sol-artificial-analysis-api-preis/). Nach der Einführungsphase verdoppelt sich der Preis auf 4 $ / 20 $ und landet beim Listenpreis von *Opus 5.5*. Wann die Einführungsphase endet, verrät Google nicht.

Wer gerade Modellentscheidungen trifft, kalkuliert deshalb schon mal besser mit dem Standardpreis als mit der Aktion – sobald es dennn etwas zu rechnen gibt.

## Comeback auf Raten

Google ist zurück im Spitzenfeld. Vorn liegt *Argon* vor allem bei Wissensarbeit, langen Dokumenten und Videos, beim agentischen Coding ist das Bild gemischt, und für meine Art, *Gemini* zu nutzen, passt das sogar, denn Recherche, Analysen und lange Markdown-Dokumente im Chat sind genau dieses Terrain. Ob *Argon* dort mehr liefert als *Gemini 3.1 Pro*, sehe ich, sobald es bei mir ankommt.

Gespannt bin ich auf den Test, den ich ohnehin vorhatte: Eine Handvoll Landingpages nach CD-Vorgaben in *Antigravity* ist Frontend-Arbeit in Reinform, also die Disziplin, an der einige Leute aus Googles eigener Belegschaft zweifeln. Passender geht ein Praxistest kaum. Bis Google die Tür aufmacht, bleibt *Argon* für mich ein Modell mit glänzenden Zeugnissen und ohne Probezeit.