Gemini Flash 3.8 : Google casse ses prix pour contrer les IA chinoises
Gemini Flash 3.8 : Google casse ses prix pour contrer les IA chinoises
Le 2 septembre 2026, Google a mis en ligne Gemini 3.8 Flash, une nouvelle itération de son modèle « rapide et économique ». En apparence, une énième mise à jour. Mais le rythme fait passer un message : c'est le troisième modèle Flash publié en six semaines, après Gemini 3.6 Flash puis Gemini 3.7 Flash en mi-août, qui avait déjà vu son tarif divisé par deux. Et le prix fait le reste : 0,75 dollar par million de tokens en entrée, 3,75 dollars en sortie, soit cinq à six fois moins cher que les modèles concurrents aux performances comparables.
Pour plusieurs observateurs, dont 01net et Ars Technica, la lecture est simple : Google mène une riposte défensive sur les prix face aux modèles chinois à bas coût, DeepSeek, Qwen ou Kimi en tête. Ces acteurs ont durablement changé l'économie du marché des API d'IA générative, et Google ne peut plus facturer ses modèles au prix fort. Explications.
Un modèle Flash toutes les trois semaines, et toujours pas de Pro
La cadence de Google sur sa gamme grand volume donne le tournis :
- Fin juillet 2026 : Gemini 3.6 Flash.
- Mi-août 2026 : Gemini 3.7 Flash, avec un tarif divisé par deux.
- 2 septembre 2026 : Gemini 3.8 Flash, au même tarif promotionnel, accompagné d'une déclinaison spécialisée en cybersécurité baptisée Flash Cyber.
Trois modèles Flash en six semaines, quatre en quatre mois selon le cabinet Artificial Analysis. Pendant ce temps, le modèle de pointe annoncé, Gemini 3.5 Pro, promis dès le mois de mai, se fait toujours attendre. Ars Technica va jusqu'à suggérer qu'il pourrait ne jamais sortir sous ce nom : Google aurait fait le choix de multiplier les versions abordables plutôt que de courir après la pointe du marché.
C'est le signe d'un recentrage stratégique : la bataille se joue désormais sur le rapport intelligence/prix, pas sur le record de benchmark.
Ce que vaut Gemini Flash 3.8
Techniquement, le modèle mis sur la table :
- Fenêtre de contexte d'un million de tokens (l'unité de facturation, à grands traits entre 600 000 et 750 000 mots), inchangée par rapport à la génération précédente.
- Entrée multimodale : texte, image, vidéo et audio, avec sortie texte.
- Trois niveaux de raisonnement (faible, moyen, élevé) : plus le niveau est haut, plus le modèle réfléchit, plus il consomme de tokens.
- Vitesse de génération d'environ 300 tokens par seconde mesurée par Artificial Analysis.
Côté performances, l'évaluation indépendante d'Artificial Analysis lui attribue un score de 59 sur 100 sur son Intelligence Index en raisonnement élevé, contre 56 pour Gemini 3.7 Flash. Cela le place au niveau de GPT-5.6 Sol et de Grok 4.6 dans leurs versions au raisonnement élevé. La progression vient surtout des tâches agentiques : sur un test d'usage d'outils en contexte bancaire (τ³-Banking), le modèle gagne 12 points.
Google, de son côté, revendique 73,7 % sur le test de programmation DeepSWE, à un cheveu de Claude Opus 5 (74 %) et devant GPT-5.6 Sol (72,7 %), pour un tarif cinq à six fois inférieur. Prudence toutefois : ces chiffres sont des mesures maison, sans validation indépendante publiée à ce jour.
Dernier né de la gamme, Flash Cyber est entraîné à détecter et corriger des failles logicielles, avec 86,2 % annoncés sur le test CyberGym. Mais son accès passe par un programme restreint, Fairwind, réservé aux gouvernements et aux « défenseurs de confiance », dont Google refuse de publier la liste. Les chercheurs indépendants et les PME repasseront.
Le prix affiché baisse, la facture, pas forcément
Le tarif mérite un détour, car il raconte à lui seul l'état du marché :
- Prix promotionnel jusqu'au 31 décembre 2026 : 0,75 $ par million de tokens en entrée, 3,75 $ en sortie.
- Au 1er janvier 2027 : les deux tarifs doublent, à 1,50 $ et 7,50 $.
- Tokens en cache : 0,075 $ par million (puis 0,15 $ en 2027), soit 90 % de remise pour les passages répétés.
- Modes Batch et Flex : tarifs environ deux fois plus bas pour le traitement différé.
La subtilité vient de la consommation. Gemini 3.8 Flash réfléchit davantage que son prédécesseur : environ 30 % de tokens de sortie en plus par tâche, et plus d'allers-retours sur les évaluations agentiques. Résultat calculé par Artificial Analysis : le coût réel par tâche grimpe de 0,40 $ à 0,58 $ (+ 45 %), malgré un prix par token inchangé. The Decoder, relayé par 01net, aboutit au même constat. En raisonnement moyen, la facture retombe à 0,41 $ par tâche, et à 0,24 $ en raisonnement faible.
Pour situer ces montants : générer une réponse de quelques centaines de mots coûte ici une fraction de centime. Et malgré cette hausse du coût réel, Artificial Analysis classe Gemini 3.8 Flash comme le modèle le moins cher à son niveau d'intelligence, sur ce que les économistes appellent la frontière de Pareto : le meilleur rapport qualité-prix du moment sur ce segment.
La guerre des prix venue de Chine
Pourquoi Google s'épuise-t-il à sortir des modèles à prix cassé ? Parce qu'en face, la pression est réelle. Les tarifs publiés par les acteurs chinois donnent le vertige :
- DeepSeek (tarifs officiels de son API) : pour sa version rapide DeepSeek V4 Flash, 0,22 $ par million de tokens en entrée hors heure de pointe (0,44 $ en pointe), 0,66 $ en sortie hors pointe. Avec cache, l'entrée tombe à 0,007 $ par million.
- Qwen (Alibaba) : le géant chinois publie librement les poids de ses modèles, téléchargeables et auto-hébergeables gratuitement sous licence permissive. Sur son API, les versions Flash de la génération actuelle tournent autour de 0,14 $ en entrée et 0,42 $ en sortie par million de tokens selon des sources secondaires, voire 0,10 $ / 0,40 $ pour le Qwen3.5 Flash.
- Kimi (Moonshot AI) : son modèle de pointe Kimi K3 facture 3 $ en entrée et 15 $ en sortie par million de tokens, et Moonshot l'a même revalorisé fin août (+ 18 % en sortie). La casse tarifaire chinoise se concentre sur les modèles efficients et open weights, pas sur les fleurons.
- GLM, MiniMax et compagnie entretiennent une pression continue sur les prix, un choix industriel désormais assumé.
Sur le prix pur du token, Google ne peut donc pas gagner contre du gratuit : un modèle open weights se télécharge et s'exécute chez soi sans rien verser à personne. D'où la riposte par un autre axe, l'efficacité : offrir la meilleure intelligence possible par dollar dépensé, avec un modèle ultra rapide et multimodal intégrable partout.
Signe que rien n'est figé non plus de l'autre côté du Pacifique : des observateurs du secteur rapportent que DeepSeek a lui-même relevé certains de ses tarifs en août 2026. La guerre des prix n'est pas une descente aux enfers unilatérale, c'est un marché qui se recalibre en temps réel.
Pourquoi Google peut se le permettre, et qui règle la facture
La stratégie de Google tient en une phrase, empruntée aux rayons des supermarchés : le produit d'appel est vendu à perte, le magasin se rattrape sur le reste du caddie. Gemini 3.8 Flash motorise dès aujourd'hui le mode IA du moteur de recherche, l'application Gemini, les outils pour développeurs et même Sheets, le tableur de la maison. Un modèle abordable partout, c'est une adoption massive.
Cette adoption a une autre vertu, moins avouable : elle produit des torrents de données d'usage, la matière première la plus disputée pour entraîner les modèles suivants. 01net le souligne : les conditions d'utilisation des versions grand public prévoient que les conversations peuvent servir à améliorer les services. Les utilisateurs des offres gratuites paient, eux, au tarif habituel : en données.
Cette cadence a enfin un coût réglementaire en Europe. Chaque modèle commercialisé dans l'Union doit livrer sa documentation technique et un résumé de ses données d'entraînement au titre de l'AI Act. Un dossier complet toutes les trois semaines, désormais.
Ce que ça change pour les développeurs et les utilisateurs
Pour les développeurs, la période est une aubaine, à condition de garder la tête froide :
- Profitez de la fenêtre : jusqu'au 31 décembre 2026, Gemini 3.8 Flash offre un rapport intelligence/prix très difficile à battre, avec un million de tokens de contexte et une entrée multimodale.
- Budgétez au tarif standard, pas au tarif promo : une application rentable à 1,50 $ / 7,50 $ le million de tokens le restera en 2027 ; l'inverse est moins sûr.
- Suivez le coût par tâche, pas le prix par token : le raisonnement élevé consomme sensiblement plus de tokens. Le niveau moyen allège la facture de près de 30 % pour une perte de deux points sur l'indice d'intelligence.
- Comparez avec l'open weights : pour des charges de travail à très gros volume, DeepSeek et Qwen restent imbattables sur le papier. Mais vérifiez les conditions d'hébergement, la confidentialité des données et la conformité RGPD au cas par cas, surtout si vous traitez des données d'Européens.
Pour le grand public, l'effet est plus indirect mais réel : la qualité des assistants IA accessibles gratuitement ou à bas prix continue de progresser, financée par cette concurrence frontale. Le vrai gagnant de la guerre des prix, c'est d'abord l'utilisateur.
Conclusion
Gemini Flash 3.8 résume l'état du marché de l'IA générative en cette rentrée 2026 : la performance rattrape, les prix s'effondrent, et la métrique qui compte n'est plus le coût du token mais le coût de la tâche accomplie. Google a renoncé à affronter de front le gratuit des modèles ouverts chinois ; il riposte par l'efficacité, la distribution et la collecte de données d'usage.
Reste une question que la fin des tarifs promotionnels, au 1er janvier 2027, permettra de trancher : cette casse des prix est-elle structurelle, ou un simple coup de promotion de rentrée ? La réponse dira si l'IA de qualité à prix cassé est devenue la norme du marché, ou une parenthèse.
Sources
- 01net, Naïm Bada, « Gemini Flash 3.8 : Google sacrifie ses prix pour contrer les IA chinoises », 3 septembre 2026
- 01net, « Gemini 3.7 Flash : Google délaisse les modèles de pointe pour affronter les IA chinoises sur le prix », 15 août 2026
- Google Cloud, « Agent Platform Pricing », tarifs officiels Gemini, consulté le 5 septembre 2026
- Artificial Analysis, « Google has released Gemini 3.8 Flash, its fourth Flash model in under four months », 2 septembre 2026
- DeepSeek, « Models & Pricing », documentation officielle de l'API, consultée le 5 septembre 2026
- Ars Technica, « Google releases Gemini 3.8 Flash, its third Flash model in six weeks », septembre 2026
- eesel AI, « Gemini 3.8 Flash review 2026: benchmarks, pricing, and the catch », septembre 2026
- Puter, « Qwen API Pricing: Full Breakdown of Costs (Sep 2026) », septembre 2026
- BenchLM, « Kimi API Pricing (September 2026) », consulté le 5 septembre 2026
- SFTPMAC, « 2026 DeepSeek Price Hike Explained », août 2026
- The Decoder, calcul du coût par tâche de Gemini 3.8 Flash, cité et relayé par 01net