Gemma 4 12B
Gemma 4 12B est un modèle multimodal à poids ouverts conçu pour fonctionner sur un ordinateur doté de 16 Go de VRAM ou de mémoire unifiée selon Google.
Un compromis local particulièrement intéressant pour réunir texte, image et audio sur une machine grand public. La promesse de 16 Go reste une exigence annoncée, pas une garantie de vitesse sur tout matériel.
01 C’est quoi
Google DeepMind a présenté Gemma 4 12B le 3 juin 2026. Le modèle comble l’écart entre Gemma E4B, orienté edge, et le modèle 26B à mélange d’experts.
Il reçoit du texte, des images et de l’audio dans une architecture unifiée sans encodeur multimodal séparé. Google publie des checkpoints préentraînés et instruction-tuned.
02 Comment ça marche
Les entrées visuelles passent par un module d’embedding léger, tandis que le signal audio brut est projeté dans le même espace que les tokens texte. Le backbone du LLM prend ensuite en charge le traitement multimodal.
Les poids sont distribués sur Hugging Face et Kaggle. Google documente des parcours avec LM Studio, Ollama, llama.cpp, MLX, SGLang, vLLM, Unsloth et ses propres outils edge ou cloud.
03 Ce que ça sait faire
Capacités documentées par l’éditeur, sans les présenter comme des tests indépendants.
✓ Capacités documentées
- ✓Entrées texte, image et audio dans un modèle de taille intermédiaire.
- ✓Exécution locale annoncée avec 16 Go de VRAM ou de mémoire unifiée.
- ✓Checkpoints préentraînés et instruction-tuned disponibles.
- ✓Compatibilité documentée avec plusieurs moteurs locaux et serveurs d’inférence.
- ✓Drafters Multi-Token Prediction fournis pour réduire la latence.
04 Limites et points de vigilance
- Les 16 Go publiés par Google décrivent une capacité d’exécution, pas une vitesse uniforme ni la place nécessaire pour tous les contextes.
- La qualité annoncée proche du modèle 26B vient des évaluations de l’éditeur.
- Un modèle local nécessite encore un moteur, du stockage, une quantification adaptée et une configuration du matériel.
- Le modèle accepte l’audio en entrée, mais la page officielle ne le présente pas comme un générateur audio natif.
- Le déploiement cloud, l’électricité et le matériel restent à la charge de l’utilisateur.
05 Versions et surfaces
- Gemma 4 12B préentraîné
- Checkpoint de base pour adaptation et recherche.
- Gemma 4 12B instruction-tuned
- Variante préparée pour suivre des consignes.
- Exécution locale
- LM Studio, Ollama, llama.cpp, MLX et autres moteurs compatibles.
- Déploiement Google Cloud
- Model Garden, Cloud Run et GKE selon la documentation Google.
- Gemma Skills
- Dépôt officiel de compétences destiné aux agents qui construisent avec Gemma.
06 Prix et accès
Tarifs et accès vérifiés en juillet 2026. Une absence de montant public n’est pas assimilée à un accès gratuit.
- Checkpoints Gemma 4 12B
- Les checkpoints sont distribués sous licence Apache 2.0 selon l’annonce Google. Aucun prix d’achat du modèle n’est affiché. Le matériel, l’hébergement et les services cloud éventuels restent séparés. Vérifié en juillet 2026.
07 Quand le choisir
- Tu veux traiter texte, image et audio sur une machine locale.
- Tu disposes d’environ 16 Go de VRAM ou de mémoire unifiée et acceptes d’ajuster la quantification.
- Tu veux choisir librement entre Ollama, LM Studio, llama.cpp ou un serveur d’inférence.
- Tu as besoin de checkpoints adaptables plutôt que d’un service uniquement hébergé.
08 Alternatives
09 Verdict
Gemma 4 12B apporte une réponse concrète aux utilisateurs qui veulent plus qu’un modèle texte local sans passer immédiatement à une très grande architecture. Son audio natif en entrée et son approche unifiée le distinguent. La fiche ne transforme toutefois pas l’exigence de 16 Go publiée par Google en promesse de confort : le format des poids, la quantification, le contexte et le moteur d’inférence déterminent encore l’expérience réelle.
10 Questions fréquentes
Gemma 4 12B fonctionne-t-il en local ?
Oui. Google le présente comme exécutable avec 16 Go de VRAM ou de mémoire unifiée et documente plusieurs moteurs locaux.
Gemma 4 12B comprend-il l’audio ?
Oui en entrée. Google le décrit comme son premier modèle de taille intermédiaire doté d’entrées audio natives.
Où télécharger Gemma 4 12B ?
Google renvoie vers Hugging Face et Kaggle pour les checkpoints préentraînés et instruction-tuned.
Gemma 4 12B est-il open source ?
Google annonce des poids accessibles sous licence Apache 2.0. La fiche parle de poids ouverts et renvoie à la licence plutôt que d’utiliser open source sans précision.
11 Sources
Sources primaires consultées le 29 juillet 2026. Les capacités annoncées restent attribuées à leur éditeur.
Comparer avant de choisir
Replace cette fiche dans son univers pour vérifier les alternatives, l’accès et les limites.