Monsieur Prompt
Fiche modèle · IA locale

Gemma 4 12B

Gemma 4 12B est un modèle multimodal à poids ouverts conçu pour fonctionner sur un ordinateur doté de 16 Go de VRAM ou de mémoire unifiée selon Google.

Vérifié le 29 juil. 20262 sources officiellesPublication : Soulinked Arts
En bref

Un compromis local particulièrement intéressant pour réunir texte, image et audio sur une machine grand public. La promesse de 16 Go reste une exigence annoncée, pas une garantie de vitesse sur tout matériel.

01 C’est quoi

Google DeepMind a présenté Gemma 4 12B le 3 juin 2026. Le modèle comble l’écart entre Gemma E4B, orienté edge, et le modèle 26B à mélange d’experts.

Il reçoit du texte, des images et de l’audio dans une architecture unifiée sans encodeur multimodal séparé. Google publie des checkpoints préentraînés et instruction-tuned.

02 Comment ça marche

Les entrées visuelles passent par un module d’embedding léger, tandis que le signal audio brut est projeté dans le même espace que les tokens texte. Le backbone du LLM prend ensuite en charge le traitement multimodal.

Les poids sont distribués sur Hugging Face et Kaggle. Google documente des parcours avec LM Studio, Ollama, llama.cpp, MLX, SGLang, vLLM, Unsloth et ses propres outils edge ou cloud.

03 Ce que ça sait faire

Capacités documentées par l’éditeur, sans les présenter comme des tests indépendants.

✓ Capacités documentées

  • Entrées texte, image et audio dans un modèle de taille intermédiaire.
  • Exécution locale annoncée avec 16 Go de VRAM ou de mémoire unifiée.
  • Checkpoints préentraînés et instruction-tuned disponibles.
  • Compatibilité documentée avec plusieurs moteurs locaux et serveurs d’inférence.
  • Drafters Multi-Token Prediction fournis pour réduire la latence.

04 Limites et points de vigilance

  • Les 16 Go publiés par Google décrivent une capacité d’exécution, pas une vitesse uniforme ni la place nécessaire pour tous les contextes.
  • La qualité annoncée proche du modèle 26B vient des évaluations de l’éditeur.
  • Un modèle local nécessite encore un moteur, du stockage, une quantification adaptée et une configuration du matériel.
  • Le modèle accepte l’audio en entrée, mais la page officielle ne le présente pas comme un générateur audio natif.
  • Le déploiement cloud, l’électricité et le matériel restent à la charge de l’utilisateur.

05 Versions et surfaces

Gemma 4 12B préentraîné
Checkpoint de base pour adaptation et recherche.
Gemma 4 12B instruction-tuned
Variante préparée pour suivre des consignes.
Exécution locale
LM Studio, Ollama, llama.cpp, MLX et autres moteurs compatibles.
Déploiement Google Cloud
Model Garden, Cloud Run et GKE selon la documentation Google.
Gemma Skills
Dépôt officiel de compétences destiné aux agents qui construisent avec Gemma.

06 Prix et accès

Tarifs et accès vérifiés en juillet 2026. Une absence de montant public n’est pas assimilée à un accès gratuit.

Checkpoints Gemma 4 12B
Les checkpoints sont distribués sous licence Apache 2.0 selon l’annonce Google. Aucun prix d’achat du modèle n’est affiché. Le matériel, l’hébergement et les services cloud éventuels restent séparés. Vérifié en juillet 2026.

07 Quand le choisir

  • Tu veux traiter texte, image et audio sur une machine locale.
  • Tu disposes d’environ 16 Go de VRAM ou de mémoire unifiée et acceptes d’ajuster la quantification.
  • Tu veux choisir librement entre Ollama, LM Studio, llama.cpp ou un serveur d’inférence.
  • Tu as besoin de checkpoints adaptables plutôt que d’un service uniquement hébergé.

08 Alternatives

09 Verdict

Gemma 4 12B apporte une réponse concrète aux utilisateurs qui veulent plus qu’un modèle texte local sans passer immédiatement à une très grande architecture. Son audio natif en entrée et son approche unifiée le distinguent. La fiche ne transforme toutefois pas l’exigence de 16 Go publiée par Google en promesse de confort : le format des poids, la quantification, le contexte et le moteur d’inférence déterminent encore l’expérience réelle.

10 Questions fréquentes

Gemma 4 12B fonctionne-t-il en local ?

Oui. Google le présente comme exécutable avec 16 Go de VRAM ou de mémoire unifiée et documente plusieurs moteurs locaux.

Gemma 4 12B comprend-il l’audio ?

Oui en entrée. Google le décrit comme son premier modèle de taille intermédiaire doté d’entrées audio natives.

Où télécharger Gemma 4 12B ?

Google renvoie vers Hugging Face et Kaggle pour les checkpoints préentraînés et instruction-tuned.

Gemma 4 12B est-il open source ?

Google annonce des poids accessibles sous licence Apache 2.0. La fiche parle de poids ouverts et renvoie à la licence plutôt que d’utiliser open source sans précision.

11 Sources

Sources primaires consultées le 29 juillet 2026. Les capacités annoncées restent attribuées à leur éditeur.

Comparer avant de choisir

Replace cette fiche dans son univers pour vérifier les alternatives, l’accès et les limites.