Monsieur Prompt
Fiche modèle · IA locale

DiffusionGemma

DiffusionGemma est un modèle texte à poids ouverts qui génère plusieurs tokens en parallèle. Google le présente comme une piste expérimentale pour accélérer fortement l’inférence locale.

Vérifié le 8 août 20261 source officiellePublication : Soulinked Arts
En bref

À choisir pour expérimenter une génération locale très rapide, pas pour remplacer sans test un modèle autoregressif mature. Google reconnaît une qualité globale inférieure à Gemma 4 standard.

01 C’est quoi

Google a présenté DiffusionGemma le 10 juin 2026. Contrairement à un LLM autoregressif qui produit les tokens l’un après l’autre, ce modèle part d’une séquence bruitée puis la raffine en parallèle.

Son architecture à mélange d’experts totalise 26 milliards de paramètres, dont 3,8 milliards sont actifs pour chaque token.

02 Comment ça marche

Le modèle débruite plusieurs positions en même temps. Cette approche vise une latence plus faible, notamment quand la sortie contient beaucoup de tokens.

Google annonce plus de 1 000 tokens par seconde sur H100 et plus de 700 sur RTX 5090. Ces chiffres viennent de l’éditeur, sur son protocole et son matériel.

03 Capacités documentées

✓ Ce que Google annonce

  • Jusqu’à quatre fois plus rapide que des modèles Gemma autoregressifs comparables sur GPU dédié.
  • Plus de 1 000 tokens par seconde sur H100 et plus de 700 sur RTX 5090.
  • Une version quantifiée annoncée sous 18 Go de VRAM.
  • Poids publiés sous licence Apache 2.0.

04 Limites

  • Le modèle est expérimental. Google recommande de l’évaluer avant un usage de production.
  • La qualité globale est inférieure à Gemma 4 standard. C’est une limite explicitement reconnue par l’éditeur.
  • Les débits publiés ne sont pas universels. Ils dépendent du GPU, de la quantification, de la longueur de sortie et du moteur utilisé.
  • Une RTX 5090 ou un H100 ne représente pas un ordinateur moyen. Le seuil sous 18 Go concerne la version quantifiée.

05 Prix et accès

Accès vérifié en août 2026. Une absence de prix d’achat ne rend pas le matériel ni l’hébergement gratuits.

Poids du modèle
Google publie les poids sous licence Apache 2.0. Aucun prix d’achat du modèle n’est annoncé.
Coût réel
GPU, électricité, stockage, hébergement et exploitation restent à la charge de l’utilisateur.

06 Quand le choisir

  • Tu explores les modèles de langage par diffusion.
  • La vitesse de génération locale compte davantage que la qualité maximale.
  • Tu disposes d’un GPU adapté et d’un protocole d’évaluation sur tes tâches.
  • Tu veux étudier ou adapter un modèle à poids ouverts sous Apache 2.0.

07 Alternatives

08 Verdict

DiffusionGemma est important parce qu’il teste une autre manière de produire du texte, avec une accélération spectaculaire annoncée sur du matériel puissant. Sa fiche doit rester prudente : Google le qualifie d’expérimental et reconnaît une qualité globale inférieure à Gemma 4 standard.

09 Questions fréquentes

DiffusionGemma est-il disponible en local ?

Oui. Google publie les poids et annonce qu’une version quantifiée tient sous 18 Go de VRAM.

Est-il plus rapide que Gemma 4 ?

Google annonce jusqu’à quatre fois plus de vitesse sur des GPU dédiés. Ce résultat reste celui de l’éditeur et dépend de la configuration.

Est-il meilleur que Gemma 4 ?

Pas globalement selon Google. L’éditeur signale une qualité générale inférieure au modèle Gemma 4 standard.

Quelle est sa licence ?

Google publie les poids sous licence Apache 2.0.

10 Source officielle

Source primaire consultée le 8 août 2026. Les performances restent attribuées à Google.

Comparer avant d’installer

Replace ce modèle expérimental dans l’écosystème local avant de choisir ton moteur et ton matériel.