Whisper
Whisper est le modèle de reconnaissance vocale open source d'OpenAI. Whisper peut transcrire en local sans coût API ; l'infrastructure reste à la charge de l'utilisateur. Voici ce qu'il vaut à l'usage.
En bref
Annoncé par OpenAI, Whisper est un modèle de reconnaissance vocale open source. Son atout : il est gratuit à exécuter en local (téléchargeable, transcription illimitée sans payer OpenAI). Il existe aussi en API (whisper-1) : transcription et traduction, 50+ langues (jusqu'à 99+), fichiers jusqu'à 25 Mo, formats mp3/mp4/m4a/wav/webm. Côté API : whisper-1 à 0,006 $/min ; les modèles GPT-4o Transcribe plus récents (précision et diarisation) sont facturés au token, pas à la minute.
01 C'est quoi
Un modèle qui transforme de l'audio en texte. On s'en sert surtout en local, pour transcrire nos vidéos sans coût.
Open source, en local
Téléchargeable et gratuit à exécuter sur ta machine : transcription illimitée sans payer OpenAI.
API whisper-1
Transcription et traduction, 50+ langues (jusqu'à 99+), fichiers jusqu'à 25 Mo, formats mp3/mp4/m4a/wav/webm.
Nouveaux modèles
Les modèles gpt-4o-transcribe, plus récents, ajoutent de la précision, mais ils sont facturés au token et ne sont pas Whisper.
02 Comment ça marche
Whisper est le seul modèle vraiment libre du lot audio, et son coût dépend d'un choix : ta machine, ou l'API d'OpenAI.
- Il est sous licence MIT, sans réserve. Le dépôt d'OpenAI, publié en 2022, porte une licence MIT pleine. Tu peux le télécharger, l'exécuter, le modifier et l'intégrer à un produit commercial sans redevance ni seuil, contrairement aux licences « ouvertes mais encadrées » d'autres modèles.
- En local, la transcription ne coûte rien d'autre que ta machine. Pas d'appel API, pas de facturation à la minute. Le seul coût est le temps de calcul, qui dépend du modèle choisi et du matériel.
- Six tailles arbitrent vitesse et précision. De tiny, environ 1 Go de mémoire vidéo, à large, environ 10 Go. Le modèle turbo, à 6 Go, est une version optimisée de large-v3 : presque aussi précis, bien plus rapide, et c'est le choix par défaut en ligne de commande.
- Il lit l'audio par fenêtres de trente secondes. En interne, il découpe le fichier en tranches de trente secondes et prédit chaque tranche à la suite. C'est transparent à l'usage, mais cela explique son comportement sur les longs fichiers.
- L'API existe pour qui ne veut pas héberger. Le modèle whisper-1 est facturé 0,006 dollar la minute d'audio. C'est la seule ligne de coût si tu passes par OpenAI plutôt que par ta propre machine.
- Il transcrit et traduit dans des dizaines de langues. Reconnaissance vocale multilingue et traduction vers l'anglais, à partir du même modèle.
Whisper reste activement maintenu, sa dernière version datant de juin 2025. OpenAI propose par ailleurs des modèles de transcription plus récents, gpt-4o-transcribe et sa variante mini, mais ceux-là sont facturés au token et non à la minute : leur coût se calcule autrement, à vérifier sur la grille officielle avant tout usage.
03 Ce que ça sait faire
Capacités documentées par OpenAI et le dépôt officiel, reprises telles quelles.
✓ Ce qui est fort
- ✓Gratuit en local : transcription illimitée sans payer OpenAI.
- ✓Sous licence MIT : téléchargeable, modifiable et commercialisable sans réserve.
- ✓Multilingue : reconnaissance et traduction dans des dizaines de langues.
- ✓Six tailles, dont turbo, qui approche la précision de large à une fraction du temps.
- ✓Une API simple, whisper-1, à 0,006 dollar la minute pour qui ne veut pas héberger.
04 Ce que ça ne sait pas faire
Les contraintes réelles, à commencer par ce que la liberté du local suppose.
- Le local exige du matériel. Faire tourner large demande environ 10 Go de mémoire vidéo. Sans machine adaptée, la « gratuité » du local n'est que théorique, et il faut se rabattre sur l'API payante.
- Il ne sépare pas les locuteurs. Whisper transcrit la parole, mais n'attribue pas les phrases à des intervenants. La diarisation demande un outil complémentaire.
- Il ne fait que transcrire et traduire. Pas de génération de voix, pas d'édition audio : c'est un modèle de reconnaissance vocale, rien de plus.
- La traduction ne va que vers l'anglais. Le modèle traduit d'une langue source vers l'anglais, pas d'une langue à une autre au choix.
- Les modèles récents d'OpenAI ne sont pas Whisper. gpt-4o-transcribe est un autre modèle, facturé au token et non libre. Confondre les deux mène à des estimations de coût fausses.
- Le comportement sur les longs fichiers demande de l'attention. Le découpage en fenêtres de trente secondes peut produire des répétitions ou des dérives sur un audio long ou bruité.
05 Les versions
Six tailles de modèle, du plus léger au plus précis, plus une variante optimisée.
- tiny et base
- 39 et 74 millions de paramètres, environ 1 Go de mémoire vidéo. Les plus rapides, pour un besoin simple ou une machine modeste.
- small et medium
- 244 et 769 millions de paramètres, 2 à 5 Go. Le compromis courant entre vitesse et précision.
- large
- 1,55 milliard de paramètres, environ 10 Go. La meilleure précision, la plus lente, multilingue uniquement.
- turbo
- 809 millions de paramètres, environ 6 Go. Une version optimisée de large-v3, presque aussi précise et bien plus rapide. Le choix par défaut en ligne de commande.
- API whisper-1
- La transcription hébergée par OpenAI, à 0,006 dollar la minute, sans rien à installer.
06 Prix & accès
Gratuit en local sous licence MIT, ou payant à la minute via l'API OpenAI.
Tarifs en date de juillet 2026. Les prix, offres et quotas affichés correspondent à l'état documenté à cette date. Ils peuvent évoluer ; consulte la source officielle citée sur la page avant achat.
- Local · gratuit
- Modèle open source sous licence MIT, transcription illimitée. Seul coût : le temps de calcul de ta machine.
- API whisper-1
- 0,006 $ par minute d'audio, sans rien à héberger.
- Modèles gpt-4o-transcribe
- Des modèles de transcription plus récents d'OpenAI, facturés au token et non à la minute. Le coût se calcule autrement, à vérifier sur la grille officielle.
Prix relevés le 16 juillet 2026. Le tarif whisper-1 à 0,006 $ la minute est confirmé sur la documentation OpenAI ; les modèles gpt-4o-transcribe sont facturés au token, leur équivalent par minute n'est pas affiché tel quel.
07 Quand le choisir
Whisper a une place précise dans une chaîne de production. Voici les cas où l'envisager.
- Transcrire un audio ou une vidéo gratuitement, en local et sans limite.
- Intégrer la transcription dans un pipeline, sans dépendre d'une API payante.
- Traiter plusieurs langues, en transcription ou en traduction.
- Basculer vers un modèle plus récent, facturé au token, si la diarisation devient nécessaire.
08 Alternatives & méthodes
La transcription n'est qu'un maillon. Voici où la relier dans une production.
09 Verdict
Whisper est le seul modèle vraiment libre du lot audio : licence MIT sans réserve, exécutable en local, sans coût par minute. Pour passer d'un audio ou d'une vidéo au texte, dans des dizaines de langues, il fait exactement le travail, et le modèle turbo approche la précision de large à une fraction du temps. Deux réserves : le local suppose une machine capable de faire tourner le modèle, et Whisper ne sépare pas les locuteurs. Pour la diarisation, il faut un outil complémentaire, ou un modèle plus récent facturé au token.
- Gratuit en local : transcription illimitée sans payer OpenAI
- Sous licence MIT : intégrable dans un pipeline sans redevance
- Des dizaines de langues (jusqu'à 99+), transcription et traduction
- API whisper-1 : fichiers jusqu'à 25 Mo, whisper-1 à 0,006 $/min
- Diarisation et précision via GPT-4o Transcribe
10 Questions fréquentes
Whisper est-il gratuit ?
Oui, en local. Whisper est open source et téléchargeable : exécuté sur ta machine, il transcrit sans limite et sans payer OpenAI. Via l'API, c'est payant : whisper-1 à 0,006 $/min. Les modèles gpt-4o-transcribe plus récents sont facturés au token, pas à la minute. Tarifs relevés le 16 juillet 2026.
Que peut faire Whisper ?
Il transcrit et traduit de l'audio dans 50+ langues (jusqu'à 99+). Via l'API whisper-1, il accepte des fichiers jusqu'à 25 Mo aux formats mp3, mp4, m4a, wav et webm. Les modèles gpt-4o-transcribe récents ajoutent précision et diarisation.
Faut-il envoyer ses fichiers à OpenAI ?
Non, pas en local. Exécuté sur ta machine, Whisper transcrit sans envoyer les fichiers à OpenAI et sans coût par minute. L'API whisper-1, elle, traite les fichiers côté OpenAI et se facture 0,006 dollar la minute.
Informations annoncées par OpenAI : github.com/openai/whisper · docs whisper-1.
De l'audio au texte, puis à la production
Une bonne transcription accélère tout le reste. Relie Whisper à une méthode complète.