michel verstrepen

@gpmt1.bsky.social

Retired, former Information Analyst : KM, CoP, AI, ICT, DigComp and edtech Wallon (Belgique - Europe) impliqué dans la formation (TIC, ICC, DigComp) et passionné d' l'IA générative (https://miver.org et https://miver.fr https://sup.miver.fr )

À la base, je voulais juste poser des bases solides pour nos futurs comparateurs sur Frandroid, Clubic et Numerama. Mais comme le sujet est passionnant (et complexe), le projet a un peu débordé et j’en ai fait un site complet : quelleia.com

Quelle IA

Classement du 28 septembre 2026 : Claude Opus 5.5, GPT-6 Astra et Claude Sonnet 5.5 en tête de 246 modèles de langage. Scores expliqués, marges d'erreur et sources de 98 benchmarks.

quelleia.com

Googles neues Spitzenmodell Gemini 4 Argon schreibt bis zu 1 Mio. Tokens und glänzt in Herstellerbenchmarks. Nutzen dürfen es vorerst nur Cyber-Verteidiger, und laut Bloomberg zweifeln Google-Mitarbeitende am Frontend-Coding. Eine Einordnung der Papierlage.

Gemini 4 Argon: Googles Comeback ins Spitzenfeld – mit Gästeliste

Google hat am 30. September Gemini 4 Argon vorgestellt, das erste Modell der Gemini-4-Generation und das erste neue Flaggschiff seit _Gemini 3.1 Pro_ im Februar. Dazwischen lagen ein auf der I/O angekündigtes und später gestrichenes Gemini 3.5 Pro sowie eine ganze Serie von Flash-Modellen, zuletzt Gemini 3.8 Flash. Mit _Argon_ will Google zurück ins Spitzenfeld, und auf dem Papier gelingt das auch. Nutzen kann das Modell allerdings fast niemand. Zum Start bekommt _Argon_ nur ein ausgewählter Kreis von „Cyber-Verteidigern“ (sorry, für die Anführungszeichen), alle anderen warten vor der Tür. Ausprobiert habe ich also nichts, das hier ist eine Einordnung der Papierlage. Die großen Gemini-Modelle stecken bei mir allerdings auch aktuell in keiner Pipeline und in keinem Workflow. Ich nutze sie im Chat für Recherche, Analysen und Dokumente, am liebsten in Markdown – genau das hatte _Gemini 3.1 Pro_ gut drauf. ## TL;DR _Gemini 4 Argon_ ist Googles neues Spitzenmodell mit bis zu 1 Mio. Output-Tokens und starken Herstellerwerten. Nutzen dürfen es vorerst nur ausgewählte Cyber-Verteidiger im Fairwind Program. * Einführungspreis 2 $ / 10 $ pro 1 Mio. Tokens, danach 4 $ / 20 $ – ein Enddatum für die Aktion nennt Google nicht. * In Googles eigener Tabelle liegt _Argon_ in 13 von 19 Zeilen allein vorn, beim agentischen Coding auf Terminal-Bench 4.0 und FrontierSWE v2 aber hinten. * Artificial Analysis misst 53 Punkte im Intelligence Index, gleichauf mit _GPT-6 Astra_ und hinter _Claude Opus 5.5_. * Laut Bloomberg zweifeln einige Google-Mitarbeitende an der Praxisleistung bei bestimmten Coding-Aufgaben, darunter Frontend-Design. ## Wer Gemini 4 Argon bekommt und wer nicht Den Anfang machen Partner aus Googles Fairwind Program, das Anfang September zusammen mit _Gemini 3.8 Flash Cyber_ gestartet ist und laut Google mehr als 650 Organisationen umfasst – vor allem Behörden, Betreiber kritischer Infrastruktur und zentrale Technologieplattformen. Ein Teil davon bekommt _Argon_ ohne Cyber-Guardrails, um Schwachstellen zu finden und zu patchen, bevor es jemand anderes tut. Parallel läuft das freiwillige Pre-Release-Verfahren der US-Regierung. Die breitere Verfügbarkeit für Entwickler, Unternehmen und Endkunden soll laut Google mit zahlenden API-Kunden und Abonnenten von _Google AI Ultra_ beginnen. Einen Termin nennt Google nicht. Eine öffentliche Model-ID in der Gemini API gibt es laut The Rundown noch nicht, und zur Gemini-App in den kleineren Abos sagt die Ankündigung nichts. Damit hakt es bei meinem Plan. Ich würde _Gemini_ in _Antigravity_ gern mal auf ein paar einfache Tasks loslassen, zum Beispiel eine Handvoll Landingpages nach Corporate Design Vorgaen (und alles schon fix und fertig als Skill). In Googles Ankündigung taucht _Antigravity_ nicht auf, gelaufen ist _Argon_ dort trotzdem schon. Im Coding Agent Index von Artificial Analysis kommt das Gespann aus _Antigravity CLI_ und _Argon_ auf 64 Punkte und Platz drei, hinter _Claude Code_ mit _Sonnet 5.5_ (68) und _Opus 5.5_ (66), aber vor _Codex_ mit _GPT-6 Astra_ (62). Gemessen wird dort immer Modell plus Harness, also genau die Kombination, die ich gern testen würde. ## Eine Million Output-Tokens Google hebt das Output-Limit von 64.000 auf eine Million Tokens an. Artificial Analysis führt _Argon_ zusätzlich mit einem Kontextfenster von einer Million Tokens, ein separates Input-Limit nennt Google zum Launch allerdings nicht. Damit lange Antworten nicht ins Timeout laufen, gibt es in der Gemini API eine neue Funktion namens Long Decode Continuation, die eine Antwort unterbricht und über Folgeanfragen fortsetzt. Im Chat merkt man davon wenig. Für Agenten, die eine Codebasis migrieren oder einen langen Vertragsentwurf schreiben, fällt dagegen eine Grenze weg, an der Arbeit bisher abbrach oder in Häppchen zerlegt werden musste. Google liefert die Beispiele aus dem eigenen Haus. _Argon_ -Agenten migrieren C- und C++-Code nach Rust, beim Zircon-Kernel von Fuchsia geht es um mehr als 800.000 Zeilen, und ein Team solcher Agenten soll in Googles Rechenzentren Speicheroptimierungen gefunden und umgesetzt haben, die über 300 TiB Arbeitsspeicher freisetzen. Unabhängig prüfen lässt sich davon nichts. Die Rust-Umbauten laufen laut Google vor dem Produktiveinsatz außerdem noch durch Audits und Reviews. Der Haken tauch dann auf der Preisliste auf: Jedes Output-Token kostet zum Einführungspreis 10 $ pro Million, danach 20 $ – eine einzige voll ausgereizte Antwort schlägt also allein beim Output mit 10 bzw. 20 $ zu Buche. Sparsam ist _Argon_ auch sonst nicht, denn laut Artificial Analysis erzeugt das Modell im Schnitt 62.000 Output-Tokens pro Index-Aufgabe, _GPT-6 Astra_ kommt mit 27.000 aus. ## Hersteller-Sternchen bei 13 von 19 Im Fließtext des Blogposts nennt Google nur Benchmarks, in denen _Argon_ vorn liegt. Die vollständige Vergleichstabelle gegen _GPT-6 Astra_ , _Claude Fable 5.1_ und Claude Opus 5.5 steckt als Grafik im Blogpost und im Launch-Post von Google DeepMind auf X. Von ihren 19 Zeilen gewinnt _Argon_ 13 allein und teilt sich bei einer weiteren den ersten Platz. VentureBeat zählt die beiden GraphWalks-Zeilen als einen Benchmark und kommt deshalb auf 12 von 18. Die Highlights aus Googles Sicht: * DeepSWE v1.1 (lange Software-Engineering-Aufgaben): 77,9 %, vor _Opus 5.5_ mit 74,2 % und _Astra_ mit 74,1 % * AutomationBench von Zapier (durchgängige Abläufe in typischen Geschäftsbereichen): 51,3 %, die Konkurrenz liegt zwischen 31,4 und 42,5 % * Harvey’s Legal Agent Benchmark (juristische Recherche und Entwürfe): 19,6 %, alle anderen unter 7 % * LVBench (Verständnis langer Videos): 91,7 %, vor _Astra_ mit 87,5 % * CWE-bench v1 (Schwachstellen beheben): 68 %, gleichauf mit _Astra_ , _Opus 5.5_ einen Punkt dahinter Die schwächeren Zeilen stehen nur in der Tabellengrafik, und heise hat sie herausgesucht. Auf Terminal-Bench 4.0 für agentisches Coding landet _Argon_ mit 57,4 % hinter allen Konkurrenten aus Googles eigener Tabelle, _Claude Opus 5.5_ kommt auf 66,4 %. Nimmt man Claude Sonnet 5.5 mit Anthropics Angabe von 70,6 % dazu, liegt ausgerechnet das Modell mehr als 13 Punkte vorn, das so viel kostet wie _Argon_ zum Einführungspreis. Auf FrontierSWE v2 hat _GPT-6 Astra_ laut MarkTechPost gut zehn Punkte Vorsprung. Das ist Googles eigene Vergleichsauswahl, eine Mischung aus eigenen Runs und Ergebnissen externer Benchmark-Betreiber. Auswahl und Präsentation stammen aber trotzdem vom Hersteller, die Brille muss man sich eben dabei aufsetzen. ### Was von außen gemessen wurde Trotz des geschlossenen Zugangs gibt es bereits unabhängige Zahlen. Artificial Analysis kommt im Intelligence Index auf 53 Punkte bei Reasoning Effort High, gleichauf mit _GPT-6 Astra_ und laut The Decoder auch mit _Claude Fable 5.1_. Vorn bleiben _Claude Opus 5.5_ mit 58 und _Claude Sonnet 5.5_ mit 56 Punkten. Beim Einführungspreis kostet _Argon_ mit 1,99 $ pro Index-Task rund 61 % von _Astra_ mit 3,26 $. Nach Ende der Aktion kalkuliert Artificial Analysis mit 3,98 $, dann wäre _Argon_ bei gleicher Messung sogar teurer. Gemeint ist jeweils ein gewichteter Durchschnitt über die Eval-Aufgaben, kein allgemeiner API-Preis. Für Recherche zählt eine andere Zahl aber mehr: Im AA-Omniscience-Test lag die Halluzinationsrate bei 15 %, der niedrigste Wert unter allen Modellen mit mindestens 45 Index-Punkten (_GPT-6 Astra_ : 51 %). Der Preis dafür steht laut The Decoder denn aber eine Zeile tiefer, denn richtig beantwortet hat _Argon_ nur 50 % der Fragen, fünf Punkte weniger als _Gemini 3.1 Pro Preview_. Das Modell passt also öfter, statt zu raten – für Recherche ist mir das aber einhundertmal lieber als umgekehrt. Auf dem Vals Index, der Aufgaben aus Finanzen, Recht, Steuern und Coding bündelt, steht _Argon_ mit 68,9 % auf Platz eins von 41 Modellen – laut Vals AI auf X zum ersten Mal ein Gemini-Modell. In der Text Arena von Arena.ai führt _Argon_ mit 1.525 Punkten, in der Code Arena für Webentwicklung reicht es nur für Platz acht (Stand jeweils 1. Oktober 2026). ## Benchmarks top, Frontend wackelig? Am Launch-Tag kam die Gegengeschichte von Bloomberg. Einige Google-Mitarbeitende mit direktem Zugang zu _Gemini 4_ sagen demnach, das Modell schneide bei echter Arbeit schwächer ab als in Benchmarks und kämpfe mit bestimmten Coding-Aufgaben. Als Beispiel nannte eine Person laut Implicator Frontend-Design, also den Teil, der bestimmt, wie eine App oder Website aussieht und sich anfühlt. Google hält es laut der Zusammenfassung bei Investing.com für falsch, _Gemini 4_ beim Coding als schwach darzustellen, und ein Mitarbeiter spricht von einem „großen Konsens“, dass das Modell an der Frontier liegt. Von außen lässt sich das nicht entscheiden. Platz acht in der WebDev-Arena, wo Menschen blind zwischen zwei Ergebnissen abstimmen, ist zumindest konsistent mit der Frontend-Kritik, bestätigt sie aber nicht. Dagegen steht Vibe Code Bench, ein Test, in dem Modelle komplette Webanwendungen bauen. Vals hat _Argon_ dort selbst gemessen und kommt in Version 1.1 auf 91,9 % und Platz zwei von 106, knapp hinter _Claude Sonnet 5.5_ mit 92,4 %. ## Prompt Injection, die Zahl für Pipelines Bevor _Argon_ breit verfügbar wird, will Google die Schutzmaßnahmen in vier Bereichen nachschärfen, nämlich bei Missbrauch für Cyber- und CBRN-Angriffe, indirekter Prompt Injection, Fehlausrichtung des Modells und abgeschotteten Testumgebungen. Gegen Fehlausrichtung überwacht Google die Chain-of-Thought und die Aktionen des Modells und bricht bei Bedarf ab. Wer Modelle fremde Inhalte lesen lässt, sollte sich eine Zahl daraus merken. Auf Gray Swans Benchmark für indirekte Prompt Injection liegt die von Google veröffentlichte Attack Success Rate bei 15 Versuchen für _Argon_ bei 0,7 %, für _Claude Opus 5.5_ bei 1,0 % und für _GPT-6 Astra_ bei 8,5 %. Konfidenzangaben fehlen, der Abstand zwischen 0,7 und 1,0 % ist also mit Vorsicht zu genießen. Für meine Chat-Nutzung spielt die Zahl kaum eine Rolle, für jeden Agenten mit Browser- oder Mailzugriff eine große. ## Günstig, solange die Aktion läuft Zum Start kostet _Argon_ 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens, cached Input bekommt 95 % Rabatt. Das entspricht dem Tokenpreis von _Claude Sonnet 5.5_ und GPT-6.1 Sol. Nach der Einführungsphase verdoppelt sich der Preis auf 4 $ / 20 $ und landet beim Listenpreis von _Opus 5.5_. Wann die Einführungsphase endet, verrät Google nicht. Wer gerade Modellentscheidungen trifft, kalkuliert deshalb schon mal besser mit dem Standardpreis als mit der Aktion – sobald es dennn etwas zu rechnen gibt. ## Comeback auf Raten Google ist zurück im Spitzenfeld. Vorn liegt _Argon_ vor allem bei Wissensarbeit, langen Dokumenten und Videos, beim agentischen Coding ist das Bild gemischt, und für meine Art, _Gemini_ zu nutzen, passt das sogar, denn Recherche, Analysen und lange Markdown-Dokumente im Chat sind genau dieses Terrain. Ob _Argon_ dort mehr liefert als _Gemini 3.1 Pro_ , sehe ich, sobald es bei mir ankommt. Gespannt bin ich auf den Test, den ich ohnehin vorhatte: Eine Handvoll Landingpages nach CD-Vorgaben in _Antigravity_ ist Frontend-Arbeit in Reinform, also die Disziplin, an der einige Leute aus Googles eigener Belegschaft zweifeln. Passender geht ein Praxistest kaum. Bis Google die Tür aufmacht, bleibt _Argon_ für mich ein Modell mit glänzenden Zeugnissen und ohne Probezeit.

t01.li

Google’s Gemini Spark can now manage your Google Photos and perform multi-step workflows across Gmail and Docs. Google and Apple have a competitive advantage in AI assistants as they have our email, calendar, documents, photos, maps, videos and phone. The question is if consumers find this useful?

Google's Gemini Spark can now manage your Google Photos library | TechCrunch

Gemini Spark can edit and curate photo albums, create shared collections, turn photos into calendar events, and handle other Google Photos tasks for AI Pro and Ultra subscribers.

techcrunch.com

ProNote, depuis le début de l'année scolaire, pour moi. "Connexion impossible L'accès à l'ENT ne semble pas être opérationnel. L'établissement en a été informé, veuillez réessayer ultérieurement"

🔥Nvidia rachète #HuggingFace pour près de 13 milliards! 10 ans après sa création #opensource Clement Delangue : "Super happy to share our intention to join forces with NVIDIA in a $12,930300000 acquisition" Et restera compatible avec les modèles d’IA, fournisseurs cloud & infra

Bild

Starbucks union calls for boycott. "‘What we’re fighting for is... $17 per hour..., enough hours to live on, better staffing... & basic workplace protections,’ said Starbucks Workers United Tuesday. ....[Starbucks']... profits... rose to $25.5 billion in 2025.” www.commondreams.org/news/why-boy...

12,000 Starbucks Workers Call for Boycott of Law-Breaking Coffee Chain | Common Dreams

Starbucks workers across the country are fighting for fair wages, better staffing, and workplace protections. Join the boycott to show solidarity and demand justice. Will you stand with them in the fi...

commondreams.org

Les 100 principaux cas d’usage de l’IA 2026 #Rediff 1️⃣ l’éventail des usages ne cesse de s’élargir, et les auteurs invitent à lire les évolutions d’une année sur l’autre comme des « déplacements d’accent » plutôt que des ruptures @Chanperco

Bild

Comparing Local Tool Calling: Gemma 4 vs. Llama 3 vs. Mistral In this article, you will learn how Gemma 4, Llama 3, and Mistral implement tool calling locally, and what trade-offs each model family presents for... Telegram AI Digest #ai #llama #mistral

Comparing Local Tool Calling: Gemma 4 vs. Llama 3 vs. Mistral

In this article, you will learn how Gemma 4, Llama 3, and Mistral implement tool calling locally, and what trade-offs each model family presents for...

machinelearningmastery.com

Bordeaux, France, has now recorded more days above 40°C in 2026 alone than during the entire 105-year period from 1920 (when observations began) to 2025. This is deeply shocking.

Bild

Les valeurs de température de juin-juillet sont tellement hors normes qu'elles nous obligent à revoir l'échelle de nos graphiques. Les chiffres sont tout simplement sidérants. 1/4

Bild

Collections In Gemini Notebook Watch Here -> https://www.youtube.com/watch?v=G6IAWt7Apzo

Collections In Gemini Notebook

When your Gemini Notebook (formerly NotebookLM) dashboard fills up with dozens (or hundreds) of notebooks, finding specific files becomes a daily headache. Google added a Collections feature to Gemini Notebook to help organize your workspace across free and paid accounts. I'll show you how the new Collections tab works, how to group your notebooks, and where the current interface falls short for team workflows. The Notebook Collections Breakdown: - Create & Group: Set up custom collections, assign emojis directly from the main view, and group related projects. - Multi-Collection Linking: Place a single notebook into multiple collections without duplicating the file or losing your place. - Dashboard Behavior: Original notebooks stay in your main list, while recent opens continue to sort by last activity. - Account Availability: Verified working on Free, Plus, and Pro Google Workspace accounts. Current Limitations & Quirks: - No Team Sharing: Collections are personal and cannot be shared with collaborators (yet). - Tab Visibility: Collections do not show up when viewing the "All" tab on your home screen. ✨ Join the NotebookLM (Gemini Notebook) Weekend Masterclass: https://maven.com/thoughts-brewing-llc/learn-notebooklm-in-a-weekend-2-cohort 🌟 REQUEST A VIDEO → https://thoughtsbrewing.com/en-us/youtube-video-request-page?utm_source=youtube ❓ ASK A QUESTION → https://thoughtsbrewing.com/en-us/ask-us-anything-business-tech?utm_source=youtube #NotebookLM #GeminiNotebook #AIQuickTips #ThoughtsBrewing ▶️ Watch our other Gemini Notebook videos: https://youtube.com/playlist?list=PLSBBW9I4ofBU&si=CwQB3naOnb_qFDmF ➡️ Subscribe: https://www.youtube.com/@thoughtsbrewingllc

youtube.com