Gemini 4 Argon : le modèle frontière de Google réservé d'abord aux défenseurs cyber

Gemini 4 Argon : le modèle frontière de Google réservé d'abord aux défenseurs cyber

Google DeepMind dévoile Gemini 4 Argon, son modèle le plus avancé, taillé pour les tâches longues et complexes : code, finance, droit, cyberdéfense. Fait notable, sa diffusion commence hors du circuit habituel, réservée à des défenseurs cyber de confiance.

Une limite de sortie portée à un million de tokens

1 million de tokens de sortie, contre 64 000 auparavant : le pari d'Argon, présenté comme un record du secteur. Quand un modèle génère des centaines de milliers de tokens en une seule trajectoire, son raisonnement gagne en profondeur au lieu de s'interrompre.

Sur les bancs d'essai cités par Google, Argon mène : état de l'art sur DeepSWE v1.1 (77,9 %), dédié au génie logiciel réel de longue haleine ; première place du Vals Index, qui évalue l'impact économique en finance, code, droit et fiscalité, pondérée par la contribution de chaque secteur au PIB américain ; première aussi sur AutomationBench de Zapier (51,3 %), qui teste l'exécution de bout en bout de fonctions métier ; état de l'art enfin sur LVBench (91,7 %), qui mesure la compréhension de vidéos longues, un atout pour analyser graphiques et documents.

Côté tarifs, lancement à 2 dollars par million de tokens en entrée et 10 en sortie, cache en entrée à 95 % de remise ; après la période introductive, 4 et 20 dollars par million.

Ce qu'Argon fait déjà chez Google

Des milliers de Googlers l'utilisent déjà pour le code spécialisé, la recherche approfondie et la rédaction. En calcul quantique, le modèle a optimisé les ressources en espace et en temps de sous-routines qui freinaient des applications clés, dépassant de 40 % la base de référence publiée en quelques minutes. Sur l'efficacité mémoire, ses agents ont analysé la télémétrie de profilage de la flotte des data centers de Google pour appliquer de manière autonome des optimisations : plus de 300 TiB libérés une fois déployé, des économies totales estimées entre 500 TiB et 1 PiB.

Argon migre aussi des bases C/C++ vers Rust, de re2 et libgav1 jusqu'au noyau Zircon de Fuchsia (plus de 800 000 lignes). Sur libgav1, le décodeur vidéo open source de Google, ses agents ont remplacé 32 000 lignes de code SIMD par du Rust sûr pour la mémoire : le décodeur tourne 2,7 fois plus vite que le port Rust, avec une sortie vidéo identique. Ces réécritures passent par audits, tests d'émulation et revues avant production.

Cyberdéfense : des capacités frontières livrées sans garde-fous

C'est le domaine qui motive la restriction. Google a entraîné Argon à trouver, valider et corriger de manière autonome des vulnérabilités critiques, et annonce publier le modèle sans garde-fous cyber pour les défenseurs de confiance et ses équipes internes, pour qu'ils en exploitent l'intégralité.

Via Scan for Good de Wiz, qui protège gratuitement des infrastructures publiques critiques, Argon a décelé une vulnérabilité critique exposant des données personnelles dans un logiciel de santé utilisé par des hôpitaux du monde entier, un risque manqué par des modèles frontière précédents.

Argon arrive aussi ex aequo en tête de CWE-bench v1 (68 %), qui évalue la remédiation de vulnérabilités, prolongeant 3.8 Flash Cyber sur la version v0. Google cite son benchmark interne (bases de code en 20 langages) et le pentest en boîte noire de Wiz, où Argon le dépasse sur la surface d'attaque, les failles et les preuves de concept.

Un accès restreint, encadré par un protocole de sécurité

Le déploiement passe par le Fairwind Program, l'initiative de cyberdéfense de Google, pour l'instant limité à un groupe restreint de partenaires selon TechCrunch. Google participe au processus volontaire américain donnant accès aux modèles avant publication, avant une ouverture aux développeurs, entreprises et consommateurs, via l'API payante et Google AI Ultra.

« Commencer le déploiement de cette manière nous donne davantage de confiance, et nous permet aussi de mettre un modèle entraîné et fort en cyberdéfense entre les mains des défenseurs dès que possible », a résumé Tulsee Doshi, responsable produit des modèles Gemini, à CNBC.

Quatre chantiers structurent cette sécurisation avant diffusion large :

  • Refus des requêtes nuisibles (cyber, CBRN) conformément au Frontier Safety Framework de DeepMind, en préservant la recherche à double usage. La surveillance des activations internes est renforcée, testée par des red teams internes et externes.
  • Injections de prompts indirectes : ces attaques détournent le comportement d'un modèle via des instructions malveillantes. Argon est le modèle de Google le plus robuste et mène le benchmark IPI de Gray Swan.
  • Surveillance des dérives d'objectif : un dispositif surveille la chaîne de pensée et les actions du modèle en continu et peut interrompre l'exécution. Même principe pour les essais d'entraînement, sans réinjecter ces résultats, de crainte que le modèle n'apprenne à esquiver la surveillance.
  • Durcissement : les bacs à sable sont isolés et scellés avant entraînement ou évaluation à haut risque, prolongeant la feuille de route de DeepMind sur la sécurité des agents.

L'annonce tombe au lendemain de la signature par Sundar Pichai d'un accord volontaire sur la sûreté de l'IA avec l'administration Trump, aux côtés de grands dirigeants technologiques, selon CNBC.

Argon face à Astra : la diffusion, nouveau champ de bataille

OpenAI a lancé Astra début septembre en la présentant comme son meilleur modèle ; Anthropic a déployé Fable et Opus plus tôt dans l'année. Google affirme qu'Argon surclasse significativement GPT-6 Astra et ces modèles sur plusieurs benchmarks, à commencer par l'indice de Vals, constat relayé par TechCrunch. CNBC nuance : sur le cyber, Argon serait au coude à coude avec GPT-6 Astra et Grok 4.7.

Reste la méthode de diffusion : sortir le modèle frontière d'abord auprès d'un cercle restreint de mains compétentes, la ligne inaugurée par son concurrent. OpenAI avait restreint la diffusion d'Astra, premier modèle classé Critical pour ses capacités offensives en cybersécurité, comme le retrace l'article sur le franchissement du seuil critique chez OpenAI, et le dossier technique sur Astra détaille ce que ses évaluations mesurent. La question n'est plus de savoir à quel point un modèle est fort, mais à qui on le confie.

La pression du marché demeure : l'application Gemini a franchi le milliard d'utilisateurs mensuels en août.

Questions fréquentes

Qu'est-ce que Gemini 4 Argon ?

Le nouveau modèle frontière de Google DeepMind, annoncé le 30 septembre 2026 pour les tâches professionnelles longues : génie logiciel, recherche financière, rédaction juridique et cyberdéfense. Sa limite de sortie atteint 1 million de tokens, contre 64 000 auparavant.

Pourquoi l'accès à Argon est-il limité aux experts en cybersécurité ?

Parce que le modèle peut trouver, valider et corriger de façon autonome des vulnérabilités critiques, une capacité sensible que Google réserve aux défenseurs de confiance via le Fairwind Program. Pour ces utilisateurs et ses équipes internes, Argon est livré sans garde-fous cyber. Ses protections sont durcies avant l'ouverture aux clients payants puis au grand public.

Combien coûte Gemini 4 Argon ?

Le prix de lancement est de 2 dollars par million de tokens en entrée et 10 en sortie, cache à 95 % de remise. Puis 4 et 20 dollars après la période introductive. Cette grille ne concerne pas encore le grand public, le modèle restant réservé aux défenseurs cyber.

Que vaut Argon face à GPT-6 Astra d'OpenAI ?

Les scores viennent surtout de Google : tête du Vals Index, devant GPT-6 Astra sur plusieurs tests. CNBC nuance : coude à coude avec GPT-6 Astra et Grok 4.7 en cybersécurité. Des évaluations indépendantes restent attendues.

Conclusion

Avec Argon, Google ne livre pas seulement un modèle frontière : il impose une méthode de lancement par cercles concentriques, en commençant par ceux que les capacités les plus sensibles peuvent aider, comme Astra avant lui. Prochaine étape à surveiller : l'ouverture aux développeurs et aux entreprises, l'efficacité réelle chez les défenseurs, où se jouera la crédibilité de Google DeepMind.

Sources

À lire aussi

À lire aussi