DiffusionGemma atteint plus de 700 jetons par seconde sur une GeForce RTX 5090

·

·

Développeur devant plusieurs écrans affichant une interface d’IA DiffusionGemma de Google DeepMind générant du texte à très grande vitesse dans un bureau moderne
Résumer cet article avec :

Imaginez un assistant IA qui ne vous fait plus attendre entre deux mots. Lancé jeudi 10 juin par Google DeepMind, DiffusionGemma casse cette limite : ce modèle expérimental génère du texte par blocs entiers. Résultat : une génération de texte jusqu’à quatre fois plus rapide que celle des grands modèles de langage classiques.


À retenir

  • DiffusionGemma, dévoilé le 10 juin, génère du texte jusqu’à quatre fois plus vite que les LLM séquentiels.
  • Il utilise une technique de diffusion discrète pour produire des blocs de 256 jetons en parallèle.
  • L’architecture MoE de 26 milliards de paramètres n’active que 3,8 milliards de paramètres par étape.
  • Sur une NVIDIA GeForce RTX 5090, il atteint plus de 700 jetons par seconde.
  • Le modèle est open source sous licence Apache 2.0 et tient dans 18 Go de VRAM après quantification.

Le modèle ne vise pas seulement les laboratoires de recherche. Il s’adresse aussi aux développeurs et aux créateurs qui veulent une IA interactive ultra-rapide sur leur propre machine, sans passer par le cloud ni exposer leurs données.

Un moteur de texte qui ne joue plus en solo

Contrairement aux grands modèles de langage qui écrivent mot après mot, DiffusionGemma s’appuie sur une approche différente. Il génère d’un coup une première version de 256 jetons, puis la peaufine en quelques passes. Cette approche, dite block autoregressive, cherche à concilier la puissance du parallélisme et la cohérence séquentielle.

Gros plan sur un GPU puissant dans un poste de travail IA avec des flux lumineux en blocs représentant la génération parallèle de texte par DiffusionGemma
La génération par blocs parallèles permet à DiffusionGemma de produire du texte beaucoup plus vite que les modèles séquentiels.

De la prédiction mot à mot au débruitage massif

Le mécanisme repose sur Uniform State Diffusion. Là où un modèle classique prédit le prochain jeton en regardant le passé, DiffusionGemma part d’une ébauche aléatoire et la « débruite » pour qu’elle devienne un texte cohérent.

« DiffusionGemma déplace le goulot d’étranglement vers la puissance de calcul du GPU. »

L’équipe de Google DeepMind

Ce fonctionnement parallèle mobilise directement la puissance de calcul du GPU, sans attendre les transferts en mémoire. La réactivité qui en découle reste hors de portée des architectures séquentielles.

Une mécanique d’experts au service de la fluidité

Pour garder de la vitesse malgré la complexité, le modèle active seulement 3,8 milliards de ses 26 milliards de paramètres à chaque étape, grâce à une architecture Mixture-of-Experts (MoE). L’attention bidirectionnelle lui permet aussi de se corriger au sein d’un même bloc, ce qui limite les répétitions et les incohérences. La fenêtre de contexte grimpe à 256 000 jetons, de quoi traiter des documents volumineux sans perdre le fil.

Une rapidité qui a un prix : le raisonnement

Google le dit clairement : pour les tâches qui demandent une logique poussée ou une réflexion en plusieurs étapes, les modèles autoregressifs comme Gemma 4 classique gardent l’avantage. DiffusionGemma mise sur le débit et la réactivité. Il est donc très bon quand il faut répondre vite, mais reste moins performant sur les benchmarks de raisonnement comme MMLU.

700 jetons par seconde sur un PC de bureau

Sur le terrain, les performances réelles tiennent la route. DiffusionGemma a été conçu pour tourner en local et tirer le meilleur des cartes graphiques récentes.

Ordinateur de bureau haut de gamme avec panneau transparent laissant voir une carte graphique NVIDIA GeForce RTX 5090 sur le bureau d’un développeur
Conçu pour tourner en local, DiffusionGemma exploite pleinement la puissance des GPU récents comme la GeForce RTX 5090.

Exploiter la puissance de calcul des GPU

Avec 700 jetons par seconde sur une GeForce RTX 5090 et plus de 1000 jetons sur un H100, il transforme la rédaction en quasi temps réel. Il tire parti des cœurs Tensor de dernière génération pour des calculs massivement parallèles. Après quantification, il tient dans 18 Go de VRAM et s’installe sur une configuration gaming haut de gamme. La collaboration avec NVIDIA a permis d’intégrer le format NVFP4, qui préserve la qualité tout en accélérant les calculs.

Un écosystème ouvert et prêt à l’emploi

Disponible dès le lancement sur vLLM, Hugging Face et NVIDIA NeMo, DiffusionGemma arrive dans les outils de développement habituels. L’intégration avec Unsloth facilite le déploiement sur des machines peu puissantes. Les créateurs de contenu y voient un atout pour compléter du code ou éditer rapidement des documents Markdown. Le modèle accepte aussi des images ou des vidéos en entrée, ce qui élargit son usage au-delà du texte pur. Un tutoriel de fine-tuning basé sur JAX est fourni pour l’adapter à des besoins métier, par exemple la génération de séquences biologiques. La licence Apache 2.0 laisse la porte ouverte à des adaptations sans contraintes.

DiffusionGemma n’est pas un remplaçant universel. C’est un nouvel outil qui change la manière d’interagir avec l’IA. Pour les tâches où la vitesse compte, il fixe un niveau de réactivité rarement vu sur un poste de travail individuel.


Sur le même Thème :

Laisser un commentaire

Trop d’infos IA ?

Inscrivez-vous à la newsletter pour recevoir un résumé hebdomadaire directement dans ta boite email (et rien d’autre)