DiffusionGemma
DiffusionGemma est un modèle texte à poids ouverts qui génère plusieurs tokens en parallèle. Google le présente comme une piste expérimentale pour accélérer fortement l’inférence locale.
À choisir pour expérimenter une génération locale très rapide, pas pour remplacer sans test un modèle autoregressif mature. Google reconnaît une qualité globale inférieure à Gemma 4 standard.
01 C’est quoi
Google a présenté DiffusionGemma le 10 juin 2026. Contrairement à un LLM autoregressif qui produit les tokens l’un après l’autre, ce modèle part d’une séquence bruitée puis la raffine en parallèle.
Son architecture à mélange d’experts totalise 26 milliards de paramètres, dont 3,8 milliards sont actifs pour chaque token.
02 Comment ça marche
Le modèle débruite plusieurs positions en même temps. Cette approche vise une latence plus faible, notamment quand la sortie contient beaucoup de tokens.
Google annonce plus de 1 000 tokens par seconde sur H100 et plus de 700 sur RTX 5090. Ces chiffres viennent de l’éditeur, sur son protocole et son matériel.
03 Capacités documentées
✓ Ce que Google annonce
- ✓Jusqu’à quatre fois plus rapide que des modèles Gemma autoregressifs comparables sur GPU dédié.
- ✓Plus de 1 000 tokens par seconde sur H100 et plus de 700 sur RTX 5090.
- ✓Une version quantifiée annoncée sous 18 Go de VRAM.
- ✓Poids publiés sous licence Apache 2.0.
04 Limites
- Le modèle est expérimental. Google recommande de l’évaluer avant un usage de production.
- La qualité globale est inférieure à Gemma 4 standard. C’est une limite explicitement reconnue par l’éditeur.
- Les débits publiés ne sont pas universels. Ils dépendent du GPU, de la quantification, de la longueur de sortie et du moteur utilisé.
- Une RTX 5090 ou un H100 ne représente pas un ordinateur moyen. Le seuil sous 18 Go concerne la version quantifiée.
05 Prix et accès
Accès vérifié en août 2026. Une absence de prix d’achat ne rend pas le matériel ni l’hébergement gratuits.
- Poids du modèle
- Google publie les poids sous licence Apache 2.0. Aucun prix d’achat du modèle n’est annoncé.
- Coût réel
- GPU, électricité, stockage, hébergement et exploitation restent à la charge de l’utilisateur.
06 Quand le choisir
- Tu explores les modèles de langage par diffusion.
- La vitesse de génération locale compte davantage que la qualité maximale.
- Tu disposes d’un GPU adapté et d’un protocole d’évaluation sur tes tâches.
- Tu veux étudier ou adapter un modèle à poids ouverts sous Apache 2.0.
07 Alternatives
08 Verdict
DiffusionGemma est important parce qu’il teste une autre manière de produire du texte, avec une accélération spectaculaire annoncée sur du matériel puissant. Sa fiche doit rester prudente : Google le qualifie d’expérimental et reconnaît une qualité globale inférieure à Gemma 4 standard.
09 Questions fréquentes
DiffusionGemma est-il disponible en local ?
Oui. Google publie les poids et annonce qu’une version quantifiée tient sous 18 Go de VRAM.
Est-il plus rapide que Gemma 4 ?
Google annonce jusqu’à quatre fois plus de vitesse sur des GPU dédiés. Ce résultat reste celui de l’éditeur et dépend de la configuration.
Est-il meilleur que Gemma 4 ?
Pas globalement selon Google. L’éditeur signale une qualité générale inférieure au modèle Gemma 4 standard.
Quelle est sa licence ?
Google publie les poids sous licence Apache 2.0.
10 Source officielle
Source primaire consultée le 8 août 2026. Les performances restent attribuées à Google.
Comparer avant d’installer
Replace ce modèle expérimental dans l’écosystème local avant de choisir ton moteur et ton matériel.