Imaginez un assistant IA qui ne vous fait plus attendre entre deux mots. Lancé jeudi 10 juin par Google DeepMind, DiffusionGemma casse cette limite : ce modèle expérimental génère du texte par blocs entiers. Résultat : une génération de texte jusqu’à quatre fois plus rapide que celle des grands modèles de langage classiques.
À retenir
- DiffusionGemma, dévoilé le 10 juin, génère du texte jusqu’à quatre fois plus vite que les LLM séquentiels.
- Il utilise une technique de diffusion discrète pour produire des blocs de 256 jetons en parallèle.
- L’architecture MoE de 26 milliards de paramètres n’active que 3,8 milliards de paramètres par étape.
- Sur une NVIDIA GeForce RTX 5090, il atteint plus de 700 jetons par seconde.
- Le modèle est open source sous licence Apache 2.0 et tient dans 18 Go de VRAM après quantification.
Le modèle ne vise pas seulement les laboratoires de recherche. Il s’adresse aussi aux développeurs et aux créateurs qui veulent une IA interactive ultra-rapide sur leur propre machine, sans passer par le cloud ni exposer leurs données.
Un moteur de texte qui ne joue plus en solo
Contrairement aux grands modèles de langage qui écrivent mot après mot, DiffusionGemma s’appuie sur une approche différente. Il génère d’un coup une première version de 256 jetons, puis la peaufine en quelques passes. Cette approche, dite block autoregressive, cherche à concilier la puissance du parallélisme et la cohérence séquentielle.

De la prédiction mot à mot au débruitage massif
Le mécanisme repose sur Uniform State Diffusion. Là où un modèle classique prédit le prochain jeton en regardant le passé, DiffusionGemma part d’une ébauche aléatoire et la « débruite » pour qu’elle devienne un texte cohérent.
« DiffusionGemma déplace le goulot d’étranglement vers la puissance de calcul du GPU. »
L’équipe de Google DeepMind
Ce fonctionnement parallèle mobilise directement la puissance de calcul du GPU, sans attendre les transferts en mémoire. La réactivité qui en découle reste hors de portée des architectures séquentielles.
Une mécanique d’experts au service de la fluidité
Pour garder de la vitesse malgré la complexité, le modèle active seulement 3,8 milliards de ses 26 milliards de paramètres à chaque étape, grâce à une architecture Mixture-of-Experts (MoE). L’attention bidirectionnelle lui permet aussi de se corriger au sein d’un même bloc, ce qui limite les répétitions et les incohérences. La fenêtre de contexte grimpe à 256 000 jetons, de quoi traiter des documents volumineux sans perdre le fil.
Une rapidité qui a un prix : le raisonnement
Google le dit clairement : pour les tâches qui demandent une logique poussée ou une réflexion en plusieurs étapes, les modèles autoregressifs comme Gemma 4 classique gardent l’avantage. DiffusionGemma mise sur le débit et la réactivité. Il est donc très bon quand il faut répondre vite, mais reste moins performant sur les benchmarks de raisonnement comme MMLU.
700 jetons par seconde sur un PC de bureau
Sur le terrain, les performances réelles tiennent la route. DiffusionGemma a été conçu pour tourner en local et tirer le meilleur des cartes graphiques récentes.

Exploiter la puissance de calcul des GPU
Avec 700 jetons par seconde sur une GeForce RTX 5090 et plus de 1000 jetons sur un H100, il transforme la rédaction en quasi temps réel. Il tire parti des cœurs Tensor de dernière génération pour des calculs massivement parallèles. Après quantification, il tient dans 18 Go de VRAM et s’installe sur une configuration gaming haut de gamme. La collaboration avec NVIDIA a permis d’intégrer le format NVFP4, qui préserve la qualité tout en accélérant les calculs.
Un écosystème ouvert et prêt à l’emploi
Disponible dès le lancement sur vLLM, Hugging Face et NVIDIA NeMo, DiffusionGemma arrive dans les outils de développement habituels. L’intégration avec Unsloth facilite le déploiement sur des machines peu puissantes. Les créateurs de contenu y voient un atout pour compléter du code ou éditer rapidement des documents Markdown. Le modèle accepte aussi des images ou des vidéos en entrée, ce qui élargit son usage au-delà du texte pur. Un tutoriel de fine-tuning basé sur JAX est fourni pour l’adapter à des besoins métier, par exemple la génération de séquences biologiques. La licence Apache 2.0 laisse la porte ouverte à des adaptations sans contraintes.
DiffusionGemma n’est pas un remplaçant universel. C’est un nouvel outil qui change la manière d’interagir avec l’IA. Pour les tâches où la vitesse compte, il fixe un niveau de réactivité rarement vu sur un poste de travail individuel.

















Laisser un commentaire
Vous devez vous connecter pour publier un commentaire.