Google a lancé Gemini 3.8 Flash le 2 septembre, ce qui porte à trois le nombre de nouveaux modèles Flash annoncés en seulement six semaines. L'entreprise le présente désormais comme son modèle Flash le plus intelligent et le destine en priorité au développement logiciel de longue durée, aux agents autonomes et aux workflows professionnels complexes.
Le modèle est déjà disponible en production dans l'API Gemini sous l'identifiant gemini-3.8-flash. Google le propose également dans AI Studio, Antigravity, Gemini Enterprise, ainsi que dans certains de ses produits grand public.
Le prix ne bouge pas encore
Gemini 3.8 Flash reprend exactement le tarif promotionnel de 3.7 Flash : 0,75 dollar par million de tokens en entrée et 3,75 dollars par million en sortie. Cette grille reste valable jusqu'au 31 décembre 2026.
Le 1er janvier 2027, elle doit doubler. Google annonce alors 1,50 dollar par million de tokens en entrée et 7,50 dollars en sortie.
Pour quelqu'un qui compare aujourd'hui 3.7 et 3.8 uniquement sur le prix affiché au million de tokens, les deux modèles semblent donc identiques. La facture réelle peut l'être beaucoup moins.
Gemini 3.8 Flash « travaille plus »
Google assume explicitement le changement. Sur une tâche complexe, Gemini 3.8 Flash peut effectuer davantage d'étapes de raisonnement, appeler des outils plusieurs fois et vérifier son propre travail en cours de route.
Cela améliore la fiabilité recherchée pour les agents longs, mais cela signifie aussi que le modèle peut utiliser davantage de tokens lorsque l'effort demandé augmente. Un meilleur prix facial ne garantit donc pas automatiquement un coût inférieur par tâche terminée.
Les développeurs peuvent régler le niveau de raisonnement sur low, medium ou high. Le niveau medium est utilisé par défaut.
Et si l'objectif principal reste de minimiser la consommation, Google conseille lui-même de réduire cet effort ou de continuer à utiliser Gemini 3.7 Flash.
Un million de tokens en entrée, 65 536 en sortie
Gemini 3.8 Flash accepte une fenêtre de contexte de 1 048 576 tokens et peut produire jusqu'à 65 536 tokens en sortie. Les entrées peuvent contenir du texte, des images, de l'audio, de la vidéo ou des PDF.
Le modèle conserve aussi une grande partie de l'arsenal Gemini destiné aux applications agentiques : function calling, exécution de code, recherche de fichiers, grounding avec Search et Google Maps, sorties structurées et contexte URL.
Computer Use est également pris en charge en preview.
Le gros pari concerne le code qui dure longtemps
Google insiste particulièrement sur DeepSWE v1.1, un benchmark destiné à évaluer des tâches d'ingénierie logicielle de longue durée. L'entreprise affirme que 3.8 Flash y dépasse la plupart des modèles de frontière plus imposants pour résoudre de manière autonome des problèmes complexes de bout en bout.
Les graphiques publiés par Google placent le modèle à 73,7 % sur DeepSWE v1.1, contre 65,3 % pour Gemini 3.7 Flash. Comme toujours avec un benchmark fourni lors du lancement d'un modèle, ce chiffre décrit un protocole précis ; il ne signifie pas que chaque dépôt Git ou chaque agent de développement progressera de huit points.
Google rapporte également 54,9 % sur HLE-Verified, contre 53,6 % pour 3.7 Flash, et met en avant des gains sur plusieurs évaluations de finance, droit, utilisation d'ordinateur et raisonnement à contexte long.
Les agents deviennent le vrai terrain de bataille
Le lancement montre surtout où Google concentre désormais ses efforts. La différence ne se joue plus uniquement sur la capacité d'un modèle à répondre correctement à un prompt isolé. Il faut qu'il puisse conserver un objectif pendant longtemps, utiliser des outils, revenir sur une étape qui a échoué et poursuivre sans transformer la boucle agentique en machine à erreurs.
Gemini 3.8 Flash devient d'ailleurs le modèle par défaut de certains agents gérés par Google, notamment dans Antigravity.
Le revers est assez mécanique : plus un agent travaille longtemps, plus chaque appel supplémentaire, chaque vérification et chaque token de raisonnement finissent par compter dans l'infrastructure et dans la facture.
Trois versions Flash en six semaines
Gemini 3.7 Flash n'avait été lancé que le 13 août, lui-même trois semaines après 3.6 Flash. Google enchaîne donc les révisions à une vitesse qui rend presque secondaire le numéro de version.
Pour les développeurs, cette cadence crée aussi une question moins spectaculaire que les benchmarks : combien de temps faut-il consacrer à évaluer, migrer et recalibrer un workflow lorsqu'un nouveau modèle arrive avant même que le précédent ait terminé son premier mois en production ?
Google garantit pour l'instant que 3.7 Flash reste disponible. Pas besoin de migrer simplement parce qu'un 8 vient de remplacer un 7.
3.8 Flash est déjà généralement disponible
Le modèle n'est pas présenté comme une preview. La documentation de l'API le classe comme généralement disponible et prêt pour les usages de production.
Il est aussi accessible aux abonnés Google AI Pro et Ultra dans l'application Gemini, dans AI Mode de Google Search et dans Gemini pour Google Sheets.
Le vrai test commencera donc rapidement : non pas savoir si 3.8 Flash gagne quelques benchmarks, mais si son surplus de raisonnement permet aux agents de terminer davantage de tâches sans que le coût réel du workflow grimpe au même rythme.