Monsieur Prompt
Fiche modèle · Vidéo IA

Gemini Omni Flash

Gemini Omni Flash est le premier modèle de la famille Omni de Google : il génère des vidéos depuis du texte, des images ou des vidéos, puis les modifie en discutant. C'est le modèle vidéo que Google recommande désormais par défaut dans son API, en preview publique depuis le 30 juin 2026.

Vérifié le 16 juil. 2026 4 sources officielles Publication : Soulinked Arts
Le nouveau défaut vidéo de Google
Le mieux pour : éditer une vidéo en discutant, tour après tour, sans redécrire la scène. À environ 0,10 $ la seconde effective, il coûte comme Veo 3.1 Fast, mais plafonne à 10 secondes par génération et reste en preview.

En bref

Gemini Omni Flash a été présenté le 19 mai 2026 à Google I/O, déployé dans l'app Gemini, Google Flow et YouTube Shorts, puis ouvert aux développeurs le 30 juin dans l'API Gemini et Google AI Studio (preview, palier payant uniquement). Il combine texte, image et vidéo en entrée, édite en langage naturel, sort des clips de 10 secondes maximum avec audio, et chaque vidéo porte le filigrane SynthID.

01 C'est quoi

Le modèle où, selon Google, la capacité de raisonner de Gemini rejoint la capacité de créer. La vidéo d'abord ; l'image et l'audio en sortie sont annoncés pour plus tard.

01

Éditer en discutant

Chaque instruction s'appuie sur la précédente : on ajuste la lumière, le décor ou l'action sans redécrire la scène.

02

Générer avec le son

Texte-vers-vidéo avec audio généré, en 16:9 ou 9:16, plusieurs plans par défaut.

03

Combiner des références

Images de personnages, croquis, vidéos de mouvement : le modèle fusionne les entrées en un clip cohérent.

04

S'ancrer dans le réel

Physique plus juste (gravité, fluides) et connaissance du monde héritée de Gemini, selon Google.

02 Comment ça marche

Un modèle conversationnel avant d'être un moteur de rendu, avec une facturation au token qui se convertit en secondes.

  • C'est le premier modèle de la famille Omni. Google le présente comme le modèle « qui peut créer n'importe quoi à partir de n'importe quelle entrée, en commençant par la vidéo ». Les sorties image et audio sont annoncées pour la suite, sans date.
  • L'édition est conversationnelle et multi-tours. Chaque tour produit une nouvelle vidéo qui garde le contexte des tours précédents. Via les sessions de l'API, jusqu'à trois éditions s'enchaînent en conservant l'historique.
  • La facturation se fait au token, pas à la seconde. Google publie la conversion : 5 792 tokens par seconde de vidéo 720p, soit un prix effectif d'environ 0,10 $ la seconde, qu'il compare lui-même à Veo 3.1 Fast.
  • Les entrées sont multimodales, avec une nuance. Texte, image et vidéo se combinent dans l'API. L'audio en entrée n'y est pas encore supporté ; côté grand public, seules les références de voix ouvrent le bal.
  • Il vit sur deux surfaces distinctes. Côté grand public : l'app Gemini, Google Flow et YouTube Shorts depuis le 19 mai 2026. Côté développeurs : l'API Gemini et Google AI Studio depuis le 30 juin, en preview payante sous l'identifiant gemini-omni-flash-preview.
  • Chaque vidéo est marquée SynthID. Le filigrane est invisible mais détectable, et Google permet de vérifier une vidéo générée via l'app Gemini, Chrome et la recherche Google.

Google recommande désormais Omni Flash comme modèle vidéo par défaut de son API, et repositionne Veo 3.1 sur les besoins spécialisés : extension de scène, contrôle de la dernière image, sortie 4K. Le duel interne est documenté sur les deux fiches.

03 Ce que ça sait faire

Capacités annoncées par Google, reprises telles quelles.

✓ Ce qui est annoncé fort

  • L'édition en langage naturel qui modifie ce qu'on demande et préserve le reste : personnages, physique et mémoire de la scène.
  • Une physique plus intuitive : gravité, énergie cinétique et dynamique des fluides, selon l'annonce.
  • La connaissance du monde de Gemini : histoire, science et contexte culturel injectés dans la narration.
  • Les références combinées : personnages, décors ou croquis en entrée pour cadrer le rendu.
  • L'audio généré avec la vidéo, et côté grand public, un avatar qui reprend sa propre voix.

04 Ce que ça ne sait pas faire

Google documente ses limites avec une franchise rare ; les voici, sans lissage.

  • 10 secondes par génération, point. Des durées plus longues sont annoncées « bientôt », sans date. La séquence se construit au montage ou par éditions successives.
  • Preview et payant uniquement. Aucun accès sur le palier gratuit de l'API, et un statut preview qui autorise Google à changer le modèle.
  • L'Europe est en retrait sur l'édition. Éditer une vidéo téléversée n'est pas disponible dans l'EEE, en Suisse et au Royaume-Uni ; téléverser des images de mineurs y est aussi bloqué, et les personnes reconnaissables ne sont pas supportées. Éditer une vidéo générée par le modèle reste possible.
  • Des trous assumés dans l'API. Pas d'audio en entrée, pas d'extension ni d'interpolation de vidéo, pas d'édition de voix, pas de raisonnement multi-vidéos ; les références vidéo de moins de 3 secondes sont acceptées par le schéma mais mal traitées à ce jour.
  • Pas de réglages classiques. Ni instructions système, ni température, ni negative prompts : les exclusions se formulent dans le prompt lui-même. La cohérence de personnage reste limitée en changement de scène ou en panoramique, dit Google.
  • La grille ne parle qu'en 720p. La conversion tokens-secondes est donnée pour la vidéo 720p ; aucune résolution supérieure n'est documentée sur la grille tarifaire. Et l'anglais est la seule langue pleinement évaluée.

05 Les versions

Un seul modèle en preview, une famille annoncée, et une distribution tierce déjà large.

Gemini Omni Flash
Le seul modèle Omni servi, en preview publique. Identifiant API gemini-omni-flash-preview. Clips de 10 secondes, 16:9 ou 9:16, plusieurs plans par défaut.
La famille Omni
Google annonce des sorties image et audio « avec le temps », sans date ni palier supplémentaire documenté.
Surfaces grand public
App Gemini, Google Flow et YouTube Shorts depuis le 19 mai 2026, en déploiement progressif.
Distribution tierce
Servi par des plateformes comme Runway (10 crédits la seconde sur sa grille API), OpenArt et Higgsfield, à leurs conditions propres.

06 Prix & accès

Grille officielle du palier payant de l'API Gemini, vérifiée le 16 juillet 2026. Le palier gratuit n'y donne pas accès.

Tarifs en date de juillet 2026. Les prix, offres et quotas affichés correspondent à l'état documenté à cette date. Ils peuvent évoluer ; consulte la source officielle citée sur la page avant achat.

Entrée
1,50 $ par million de tokens, que l'entrée soit du texte, de l'image, de la vidéo ou de l'audio.
Sortie vidéo
17,50 $ par million de tokens. Google publie la conversion : 5 792 tokens par seconde de vidéo 720p, soit environ 0,10 $ la seconde.
Sortie texte
9,00 $ par million de tokens, tokens de raisonnement compris.
Palier gratuit
Non disponible pour ce modèle. Sur le palier payant, Google indique ne pas utiliser les données pour améliorer ses produits.
Accès grand public
Via l'app Gemini, Google Flow et YouTube Shorts ; les billets d'annonce ne détaillent pas de tarification dédiée pour ces surfaces.

Le prix effectif d'environ 0,10 $ la seconde est celui que Google compare lui-même à Veo 3.1 Fast. La grille ne documente que la conversion 720p : pour d'autres résolutions, rien n'est publié.

07 Quand le choisir

Omni Flash gagne quand la vidéo se travaille par itérations, plus que par générations isolées.

  • Tu veux retoucher un plan en discutant : changer la lumière, le décor ou l'action sans repartir de zéro.
  • Tu enchaînes image puis vidéo : Google documente le duo Nano Banana 2 Lite pour l'image, Omni Flash pour l'animer.
  • Tu produis des formats courts sonorisés à petit budget, en 16:9 ou 9:16.
  • Tu veux transformer une vidéo existante en autre chose, hors EEE, Suisse et Royaume-Uni pour le téléversement.
  • Si tu as besoin d'extension de scène, de 4K ou du contrôle de la dernière image, regarde plutôt Veo 3.1 ; pour le mouvement physique pur, compare avec Seedance.

08 Alternatives

Le bon modèle dépend du plan à produire.

Voir tous les modèles vidéo IA

09 Verdict

Omni Flash change la question : non plus « quelle vidéo générer », mais « comment la modifier ». L'édition conversationnelle qui préserve la scène, la facturation lisible une fois convertie (environ 0,10 $ la seconde en 720p) et la place que Google lui donne, devant Veo dans sa propre documentation, en font le point de départ naturel côté API Gemini. Ses bornes sont tout aussi nettes : 10 secondes par clip, preview payante, Europe privée de l'édition de vidéos téléversées, et aucun benchmark chiffré dans les billets d'annonce, Google renvoyant vers sa page DeepMind. Un modèle à adopter pour itérer, pas encore pour bâtir une production critique.

  • Formuler les exclusions dans le prompt : les negative prompts n'existent pas
  • Demander explicitement un plan continu : le modèle multi-plans par défaut
  • Itérer par petites retouches : les prompts d'édition simples marchent mieux
  • Vérifier la disponibilité régionale avant de promettre l'édition de rushes
  • Comparer avec Veo 3.1 dès qu'extension ou 4K entrent en jeu

10 Questions fréquentes

Combien coûte Gemini Omni Flash ?

Dans l'API Gemini, il se facture au token, sur le palier payant uniquement : 1,50 dollar par million de tokens en entrée, 17,50 dollars par million en sortie vidéo. Google chiffre la conversion : 5 792 tokens par seconde de vidéo 720p, soit environ 0,10 dollar la seconde, le même prix effectif que Veo 3.1 Fast. Tarifs de juillet 2026.

Peut-on éditer une vidéo déjà filmée avec Omni Flash ?

Oui, on peut téléverser une vidéo et la modifier en langage naturel, mais pas partout : Google indique que l'édition de vidéos téléversées n'est pas disponible dans l'Espace économique européen, en Suisse et au Royaume-Uni. Éditer une vidéo générée par le modèle reste possible dans ces régions.

Quelle est la durée maximale d'une vidéo Omni Flash ?

10 secondes par génération actuellement, en 16:9 ou 9:16. Google annonce des durées plus longues à venir, sans date. La vidéo finale se construit donc au montage, ou par éditions successives, jusqu'à trois enchaînées via les sessions de l'API.

Omni Flash ou Veo : lequel choisir ?

Google recommande Gemini Omni Flash comme modèle vidéo par défaut de son API, et réserve Veo 3.1 aux besoins précis : extension de scène, contrôle de la dernière image, sortie 4K. Pour éditer en discutant et combiner des références, Omni Flash ; pour prolonger un plan existant ou viser la 4K, Veo 3.1.

11 Sources

Sources primaires consultées le 16 juillet 2026.

Passe de l'outil à la méthode

Le bon outil dépend du plan à produire : une grille de décision évite les tests à l'aveugle.