Les Gemma 4 QAT de Google DeepMind réduisent de 72 % la mémoire des IA sans perte notable de performance

·

·

Un utilisateur consulte un assistant IA Gemma 4 QAT de Google DeepMind sur un smartphone et un ordinateur portable, illustrant la reduction de la memoire et l’execution locale des modeles.
Résumer cet article avec :

Annoncée le 5 juin dernier, la dernière version des modèles Gemma 4 de Google DeepMind réduit l’écart entre IA de pointe et matériel grand public. Grâce à l’entraînement conscient de la quantification (QAT), ces modèles compressés consomment 72 % de mémoire vive en moins, sans perdre grand-chose en qualité. On peut donc faire tourner un assistant multimodal en local sur un smartphone ou un portable standard.

À retenir

  • Les modèles Gemma 4 QAT réduisent la consommation mémoire de 72 % par rapport aux versions classiques.
  • Le plus petit modèle, E2B, passe de 11,4 Go à environ 1 Go de VRAM.
  • La qualité est préservée à plus de 98 %, grâce à un entraînement simulant la précision 4 bits.
  • Toute la gamme, du 2B au 31B, bénéficie de ces optimisations sous licence Apache 2.0.
  • Les poids sont disponibles sur Hugging Face, Kaggle et immédiatement compatibles avec Ollama.

Pour Google, l’objectif est double : sortir les applications d’IA du cloud et rendre les performances des grands modèles plus accessibles. Les entreprises y gagnent en confidentialité, les développeurs en rapidité de prototypage, et les utilisateurs en autonomie. Quand les modèles tournent hors ligne sur des machines ordinaires, la promesse d’une IA agentique embarquée devient beaucoup plus concrète.

Le QAT, une compression qui préserve l’intelligence

Contrairement à la quantification post-entraînement (PTQ), qui altère les poids après coup, le Quantization-Aware Training intègre la faible précision pendant l’apprentissage. Résultat : moins d’erreurs d’arrondi et une fidélité quasi parfaite.

Un ingénieur IA observe sur plusieurs écrans des visualisations de réseaux de neurones et de compression, symbolisant le Quantization-Aware Training qui préserve la qualité des modèles Gemma 4.
Le QAT permet de compresser fortement les modèles tout en conservant une fidélité proche de celle des versions en haute précision.

La fin des dégradations liées à la compression

Les tests internes le confirment : les versions QAT conservent plus de 98 % de la qualité du modèle haute précision original.

Les versions QAT conservent plus de 98 % de la qualité du modèle original.

Google DeepMind, juin 2026

Concrètement, l’empreinte mémoire du modèle E2B tombe de 11,4 Go à environ 1 Go, et même à 0,84 Go pour les usages purement textuels. C’est ce qui rend l’IA générative viable sur des téléphones d’entrée de gamme.

Une recette mobile taillée pour les NPU

Google a conçu une recette de quantification mobile spécifique, avec des activations statiques et une quantification par canal. L’objectif est d’optimiser le décodage sur les unités de traitement neuronal (NPU) des smartphones récents. Cette approche réduit la latence et la consommation électrique, ce qui rend les assistants multimodaux réellement utilisables en mobilité, sans dépendre du Wi-Fi.

Du laboratoire à la machine du quotidien

Ces optimisations ne servent à rien si elles restent difficiles à déployer. Google les a mis à disposition rapidement pour que l’écosystème suive.

Un utilisateur assis dans son salon utilise un smartphone et un ordinateur portable ordinaires pour interagir avec un assistant IA local, sans connexion au cloud.
Des modèles Gemma 4 QAT taillés pour chaque machine rendent l’IA générative accessible du smartphone d’entrée de gamme au portable standard.

Un modèle pour chaque besoin, du petit au très grand

La gamme couvre tous les cas, ou presque : E2B pour les smartphones, 12B Unified pour les ordinateurs portables standards (multimodal sans encodeur séparé), 26B-A4B pour les MacBook Pro équipés de 16 Go de RAM, et 31B pour les stations de travail dotées d’un GPU dédié. Le modèle 26B-A4B, qui nécessitait auparavant des serveurs, tourne désormais confortablement sur un portable grand public.

Déploiement direct dans l’écosystème open source

Les checkpoints QAT sont immédiatement disponibles sur Hugging Face et Kaggle, au format GGUF, avec une compatibilité native pour Ollama, llama.cpp et vLLM. La suite LiteRT-LM permet de servir un modèle via une API compatible OpenAI en quelques lignes. Le tout sous licence Apache 2.0, sans restriction d’usage commercial.

Les limites de la compression QAT

Malgré une fidélité remarquable, les 2 % de perte résiduelle peuvent peser sur des tâches de raisonnement mathématique très complexes ou de génération de code ultra-structuré. Le modèle 31B exige toujours une carte graphique d’au moins 16 Go de VRAM, ce qui exclut les ultraportables sans GPU dédié. Les gains les plus spectaculaires n’apparaissent qu’avec des NPU récentes ; sur les smartphones plus anciens, le bénéfice reste limité.

Avec ces nouvelles versions, Google DeepMind montre qu’une IA puissante peut aussi tenir dans la poche. Les applications locales, privées et réactives ne relèvent plus du prototype.


Sur le même Thème :

Laisser un commentaire

Trop d’infos IA ?

Inscrivez-vous à la newsletter pour recevoir un résumé hebdomadaire directement dans ta boite email (et rien d’autre)