Annoncée le 5 juin dernier, la dernière version des modèles Gemma 4 de Google DeepMind réduit l’écart entre IA de pointe et matériel grand public. Grâce à l’entraînement conscient de la quantification (QAT), ces modèles compressés consomment 72 % de mémoire vive en moins, sans perdre grand-chose en qualité. On peut donc faire tourner un assistant multimodal en local sur un smartphone ou un portable standard.
À retenir
- Les modèles Gemma 4 QAT réduisent la consommation mémoire de 72 % par rapport aux versions classiques.
- Le plus petit modèle, E2B, passe de 11,4 Go à environ 1 Go de VRAM.
- La qualité est préservée à plus de 98 %, grâce à un entraînement simulant la précision 4 bits.
- Toute la gamme, du 2B au 31B, bénéficie de ces optimisations sous licence Apache 2.0.
- Les poids sont disponibles sur Hugging Face, Kaggle et immédiatement compatibles avec Ollama.
Pour Google, l’objectif est double : sortir les applications d’IA du cloud et rendre les performances des grands modèles plus accessibles. Les entreprises y gagnent en confidentialité, les développeurs en rapidité de prototypage, et les utilisateurs en autonomie. Quand les modèles tournent hors ligne sur des machines ordinaires, la promesse d’une IA agentique embarquée devient beaucoup plus concrète.
Le QAT, une compression qui préserve l’intelligence
Contrairement à la quantification post-entraînement (PTQ), qui altère les poids après coup, le Quantization-Aware Training intègre la faible précision pendant l’apprentissage. Résultat : moins d’erreurs d’arrondi et une fidélité quasi parfaite.

La fin des dégradations liées à la compression
Les tests internes le confirment : les versions QAT conservent plus de 98 % de la qualité du modèle haute précision original.
Les versions QAT conservent plus de 98 % de la qualité du modèle original.
Google DeepMind, juin 2026
Concrètement, l’empreinte mémoire du modèle E2B tombe de 11,4 Go à environ 1 Go, et même à 0,84 Go pour les usages purement textuels. C’est ce qui rend l’IA générative viable sur des téléphones d’entrée de gamme.
Une recette mobile taillée pour les NPU
Google a conçu une recette de quantification mobile spécifique, avec des activations statiques et une quantification par canal. L’objectif est d’optimiser le décodage sur les unités de traitement neuronal (NPU) des smartphones récents. Cette approche réduit la latence et la consommation électrique, ce qui rend les assistants multimodaux réellement utilisables en mobilité, sans dépendre du Wi-Fi.
Du laboratoire à la machine du quotidien
Ces optimisations ne servent à rien si elles restent difficiles à déployer. Google les a mis à disposition rapidement pour que l’écosystème suive.

Un modèle pour chaque besoin, du petit au très grand
La gamme couvre tous les cas, ou presque : E2B pour les smartphones, 12B Unified pour les ordinateurs portables standards (multimodal sans encodeur séparé), 26B-A4B pour les MacBook Pro équipés de 16 Go de RAM, et 31B pour les stations de travail dotées d’un GPU dédié. Le modèle 26B-A4B, qui nécessitait auparavant des serveurs, tourne désormais confortablement sur un portable grand public.
Déploiement direct dans l’écosystème open source
Les checkpoints QAT sont immédiatement disponibles sur Hugging Face et Kaggle, au format GGUF, avec une compatibilité native pour Ollama, llama.cpp et vLLM. La suite LiteRT-LM permet de servir un modèle via une API compatible OpenAI en quelques lignes. Le tout sous licence Apache 2.0, sans restriction d’usage commercial.
Les limites de la compression QAT
Malgré une fidélité remarquable, les 2 % de perte résiduelle peuvent peser sur des tâches de raisonnement mathématique très complexes ou de génération de code ultra-structuré. Le modèle 31B exige toujours une carte graphique d’au moins 16 Go de VRAM, ce qui exclut les ultraportables sans GPU dédié. Les gains les plus spectaculaires n’apparaissent qu’avec des NPU récentes ; sur les smartphones plus anciens, le bénéfice reste limité.
Avec ces nouvelles versions, Google DeepMind montre qu’une IA puissante peut aussi tenir dans la poche. Les applications locales, privées et réactives ne relèvent plus du prototype.

















Laisser un commentaire
Vous devez vous connecter pour publier un commentaire.