Google a dégainé le 2 septembre son troisième modèle Flash en six semaines. Gemini 3.8 Flash ne mise pas sur la taille, mais sur la ténacité : il réfléchit plus longtemps pour mieux coder. Le tarif reste inchangé, mais seulement jusqu’au 31 décembre.
À retenir
- Troisième Flash en six semaines : lancement le 2 septembre 2026, trois semaines seulement après la version 3.7.
- Performances en hausse : 90,8 % sur Terminal-Bench 2.1 contre 81,6 % pour la génération précédente.
- Architecture inchangée côté mémoire : fenêtre d’un million de jetons et jusqu’à 64 000 jetons en sortie.
- Déclinaison Cyber dédiée à la sécurité, accessible uniquement via le programme Fairwind et ses 650 partenaires.
- Tarif d’appel maintenu jusqu’à fin 2026 : 0,64 € le million de jetons en entrée, puis doublement le 1er janvier 2027.
Google ne cherche plus seulement à lancer le plus gros modèle, mais celui que les développeurs peuvent utiliser chaque jour. Avec ce Flash qui raisonne par étapes, le groupe vise ceux qui confient déjà du code à des agents autonomes, tout en gardant la main sur les prix et la sécurité.
Un sprinteur qui réfléchit avant de coder
Google DeepMind préfère enchaîner les itérations rapides plutôt que d’attendre un grand lancement annuel. La version 3.8 arrive à peine trois semaines après la 3.7.
Une méthode qui découpe les problèmes en étapes
Gemini 3.8 Flash a été optimisé pour l’ingénierie logicielle de longue haleine, ou long-horizon. Le modèle ne répond plus en une seule passe. Il décompose chaque consigne en sous-étapes logiques, appelle des outils de manière itérative et vérifie ses résultats intermédiaires. Cette approche se règle sur trois niveaux d’effort de raisonnement, selon le compromis recherché entre latence, coût et qualité. Un jeton, l’unité de facturation, correspond à environ quatre caractères ; chaque étape supplémentaire en consomme. L’architecture conserve une fenêtre de contexte d’un million de jetons, assez large pour ingérer un dépôt de code entier, et peut générer jusqu’à 64 000 jetons d’un seul tenant.

Le modèle est disponible immédiatement là où les développeurs travaillent déjà. Il est déployé dans Google AI Studio, l’API Gemini, Android Studio, Gemini Enterprise et le nouvel environnement Google Antigravity 2.0. Le grand public y accède aussi via l’application Gemini et le mode AI Mode de la recherche, pour les abonnés Google AI Pro et Ultra. La cadence est nette : Gemini 3.6 Flash fin juillet, 3.7 mi-août, 3.8 début septembre.
Des scores qui talonnent les modèles frontières
Sur le papier, Flash affiche des résultats dignes de modèles bien plus lourds. Il atteint 90,8 % sur Terminal-Bench 2.1 selon DataCamp, contre 81,6 % pour Gemini 3.7 Flash. Ce benchmark teste la capacité à résoudre des tâches en ligne de commande dans un terminal isolé, comme le ferait un développeur junior. Sur DeepSWE v1.1, qui évalue la résolution autonome de tickets logiciels réels, il dépasse la majorité des modèles frontières beaucoup plus lourds, d’après The Verge. Son score de 54,9 % sur HLE-Verified, un examen exigeant en sciences, finance et droit, confirme aussi ses progrès en raisonnement général.
| Benchmark | Gemini 3.7 Flash | Gemini 3.8 Flash | Enjeu |
|---|---|---|---|
| Terminal-Bench 2.1 | 81,6 % | 90,8 % | Exécution de tâches en terminal |
| HLE-Verified | — | 54,9 % | Raisonnement STEM et juridique |
| CWE-Bench (remédiation) | — | 47,2 % | Correction automatique de failles |
Pour les adeptes du vibe coding, cette pratique où l’on décrit une intention en langage naturel et où l’IA génère le code, ce gain compte. Le modèle produit des architectures complètes sans perdre le fil sur des projets longs. Il fonctionne dans un flux agentique, où l’agent autonome enchaîne les actions sans intervention humaine.
Une version Cyber réservée aux défenseurs
Google accompagne son annonce d’une variante spécialisée, Gemini 3.8 Flash Cyber. Elle cible les équipes chargées de détecter et de corriger les failles.
Des résultats concrets sur la chasse aux failles
Les deux modèles partagent le même socle, mais la version Cyber a suivi des boucles d’entraînement supplémentaires en sécurité. Sur un banc d’essai interne couvrant 20 langages, elle affiche un taux supérieur à 70 % de découverte de vulnérabilités réelles, selon le Google Blog. Sur CWE-Bench, qui mesure la génération de correctifs pour des failles répertoriées, elle obtient 47,2 % en pass@1, proche des 47,8 % des plus grands modèles frontières. L’équipe Chrome Security rapporte avoir généré 2,6 fois plus de correctifs valides qu’avec les meilleurs modèles commerciaux de taille supérieure.
Nous voulons donner un avantage décisif aux défenseurs, pas aux attaquants.
Message porté par Google lors de l’annonce du programme Fairwind
Le modèle intègre des protections renforcées contre l’injection de prompt, ou IPI, une technique qui détourne une IA en lui glissant des instructions cachées. Il a été évalué selon le standard Gray Swan et le Frontier Safety Framework de Google.
Un accès filtré par le programme Fairwind
Gemini 3.8 Flash Cyber n’est pas en libre-service. Son accès est réservé à des acteurs de confiance via le programme Fairwind. Lancé le même jour, ce dispositif réunit plus de 650 organisations partenaires, dont des gouvernements et des opérateurs critiques. On y trouve CrowdStrike, Datadog ou Palo Alto Networks. Google veut limiter les usages offensifs tout en diffusant ces outils de défense. Les protections développées pour la variante Cyber sont ensuite intégrées à la gamme Flash standard.
Un prix d’appel qui cache une addition plus salée
Le prix affiché n’a pas bougé, mais la facture réelle peut surprendre. Le raisonnement supplémentaire consomme aussi davantage de jetons.

La charge cachée : 30 % de jetons en plus
Google reconduit son tarif d’introduction : 0,64 € le million de jetons en entrée et 3,19 € en sortie jusqu’au 31 décembre 2026, d’après Frandroid. Au 1er janvier 2027, les prix doublent à 1,28 € et 6,38 €. En dollars, cela correspond à 0,75 $ et 3,75 $, puis 1,50 $ et 7,50 $. À l’unité, c’est 5 à 7 fois moins cher que Claude Opus 5 (4,25 € / 21,25 €) ou GPT-5.6 Sol (3,40 € / 17 €). Sauf que Gemini 3.8 Flash consomme près de 30 % de jetons de sortie en plus sur les tâches complexes, selon The Verge, précisément parce qu’il réfléchit davantage.
Le modèle qui travaille plus longtemps facture davantage d’étapes de raisonnement. Un token de raisonnement est un jeton interne généré pour structurer sa réflexion avant la réponse finale, et il est facturé. Pour une requête simple, le surcoût reste marginal. Pour un ticket logiciel impliquant plusieurs outils et vérifications, l’addition grimpe. C’est le compromis entre qualité et volume.
Comment garder la facture sous contrôle
Google recommande de moduler l’effort selon le cas d’usage. Les trois niveaux réduisent la réflexion pour les tâches qui exigent peu de latence. Pour les requêtes simples du quotidien, la firme conseille même de rester sur Gemini 3.7 Flash, moins gourmand. Les entreprises doivent aussi prévoir le doublement des prix en janvier dans leurs budgets. Le tarif promotionnel aide à tester et à déployer vite, mais il expire. Le coût par tâche, plutôt que le prix au million de jetons, devient l’indicateur à surveiller.
Jusqu’au 31 décembre, Google vend ce temps de réflexion à prix réduit. À partir du 1er janvier 2027, les développeurs devront vérifier si les meilleurs scores de Flash compensent vraiment la hausse de leur facture.

















Laisser un commentaire
Vous devez vous connecter pour publier un commentaire.