Llama
La famille de modèles ouverts de Meta. Voici ce qu'elle propose aujourd'hui, d'après ce qu'annonce Meta : Llama 4 en architecture Mixture-of-Experts, ses variantes, sa licence open-weight, ses forts et ses limites.
En bref
Llama est la famille de modèles ouverts de Meta. La génération actuelle est Llama 4 (5 avril 2025), la première en architecture Mixture-of-Experts. Trois variantes : Scout (tient sur un seul GPU haut de gamme, contexte 10 M tokens), Maverick (17 Md de paramètres actifs sur 128 experts, 400 Md au total) et Behemoth, encore en preview mi-2026. La licence est dite open-weight : usage commercial permis, mais avec restrictions et politique d'usage acceptable de Meta. Pour rester honnête : Llama 4 reste la dernière génération, il n'y a ni Llama 5 ni Behemoth sorti.
01 C'est quoi
Une famille ouverte, pensée pour l'auto-hébergement. Meta met en avant trois variantes de Llama 4.
Scout
Tient sur un seul GPU haut de gamme, avec un contexte de 10 millions de tokens. La variante la plus accessible à héberger.
Maverick
17 Md de paramètres actifs sur 128 experts (400 Md au total). Au lancement, au-dessus de GPT-4o et Gemini 2.0 Flash sur MMLU, MATH et la compréhension d'image.
Behemoth (preview)
Encore en preview et en entraînement mi-2026. À ne pas présenter comme sorti : c'est un modèle annoncé, pas disponible.
02 Comment ça marche
Llama est présenté comme ouvert. Sa licence, elle, est un contrat avec des obligations précises qu'il faut lire.
- Au-delà de 700 millions d'utilisateurs, tu dois demander l'autorisation. C'est le seuil exact de la licence communautaire : si les produits que tu proposes dépassent 700 millions d'utilisateurs actifs mensuels le mois précédant la sortie de la version, tu dois solliciter une licence auprès de Meta. C'est une clause qui vise nommément les très grandes plateformes.
- Tu dois afficher « Built with Llama ». La licence impose de le mentionner de façon visible sur un site, une interface, un billet ou la documentation du produit. Ce n'est pas une suggestion de courtoisie.
- Tout modèle dérivé doit s'appeler Llama. Si tu entraînes ou affines un modèle à partir de Llama et que tu le distribues, son nom doit commencer par « Llama ». La licence contraint donc jusqu'au nom de ton travail.
- Ce n'est ni Apache 2.0 ni MIT. C'est une licence maison, la Llama 4 Community License Agreement, assortie d'une politique d'usage acceptable qui interdit notamment les applications militaires, l'armement, le nucléaire et l'espionnage. À comparer avec la MIT de DeepSeek, qui n'impose rien de tout cela.
- L'architecture n'active qu'une fraction du modèle. Meta l'explique lui-même : dans un modèle à mélange d'experts, un token n'active qu'une part des paramètres totaux. Scout et Maverick partagent ainsi 17 milliards de paramètres actifs, pour 109 et 400 milliards au total.
- La multimodalité est native, pas rapportée. Meta décrit une fusion précoce qui intègre les tokens de texte et de vision dès l'entraînement, avec des modèles pré-entraînés sur jusqu'à 48 images.
Le domaine llama.com n'héberge plus son contenu. Au 16 juillet 2026, il répond par une redirection permanente vers developer.meta.com/ai/, y compris pour les pages de licence et de politique d'usage. Le texte légal reste consultable sur le dépôt officiel de Meta.
03 Ce que ça sait faire
Capacités annoncées par Meta, reprises telles quelles.
✓ Ce qui est annoncé fort
- ✓Écosystème ouvert : le plus déployé, idéal pour l'auto-hébergement.
- ✓Mixture-of-Experts : première génération Llama en MoE, avec Scout et Maverick.
- ✓Long contexte : jusqu'à 10 M tokens sur Scout, sur un seul GPU haut de gamme.
- ✓Personnalisation : poids téléchargeables, adaptables à ton usage.
04 Ce que ça ne sait pas faire
Les contraintes réelles, à commencer par ce que le mot « ouvert » recouvre ici.
- Ce n'est pas de l'open source au sens courant. Seuil d'utilisateurs, obligation d'affichage, contrainte de nommage, usages interdits : la licence est un contrat, pas une permission générale. Le terme exact est open-weight, et il compte.
- Le modèle le plus capable n'est jamais sorti. Behemoth, annoncé avec 288 milliards de paramètres actifs et près de deux billions au total, était encore en entraînement au moment de l'annonce. Ce n'est donc pas une option disponible.
- L'annonce de référence date d'avril 2025. Le billet qui documente Llama 4, ses tailles et ses architectures a été publié le 5 avril 2025. C'est la source primaire la plus récente sur cette génération, et elle a plus d'un an.
- Meta ne vend pas de tokens. Aucune grille tarifaire n'existe côté Meta : le modèle se télécharge, et le coût est celui de ton infrastructure ou de l'hébergeur tiers que tu choisis.
- Les fenêtres de contexte ne sont pas toutes publiées. Scout annonce dix millions de tokens, mais l'annonce ne donne aucun chiffre pour Maverick ni pour Behemoth.
- Le site officiel a déménagé. llama.com redirige désormais vers developer.meta.com, et les pages de licence y sont rendues côté client. Le texte légal se lit plus sûrement sur le dépôt officiel que sur le site.
05 Les versions
Trois modèles annoncés, deux disponibles. Tous partagent une architecture à mélange d'experts.
- Llama 4 Scout
- 17 milliards de paramètres actifs, 16 experts, 109 milliards au total. Sa fenêtre de contexte est annoncée à dix millions de tokens, la plus large du lot par un ordre de grandeur. Téléchargeable.
- Llama 4 Maverick
- 17 milliards de paramètres actifs, 128 experts, 400 milliards au total. Même coût d'inférence par token que Scout, pour quatre fois plus de paramètres disponibles. Téléchargeable.
- Llama 4 Behemoth
- 288 milliards de paramètres actifs, 16 experts, près de deux billions au total. Annoncé comme encore en entraînement, donc indisponible.
- La licence
- Llama 4 Community License Agreement, datée du 5 avril 2025. Usage commercial permis sous conditions : seuil de 700 millions d'utilisateurs actifs mensuels, mention « Built with Llama », préfixe « Llama » sur les dérivés.
- La politique d'usage
- Une Acceptable Use Policy distincte interdit notamment la violence, l'exploitation de mineurs, la pratique professionnelle non autorisée en finance, droit et médecine, les logiciels malveillants, l'usurpation d'identité, ainsi que les applications militaires, l'armement, le nucléaire et l'espionnage.
- Accès
- Poids téléchargeables depuis les canaux officiels de Meta et depuis Hugging Face. Des hébergeurs tiers les servent aussi en API, à leurs propres tarifs.
06 Prix & accès
Des modèles ouverts à télécharger et héberger, sous une licence open-weight encadrée.
Tarifs en date de juillet 2026. Les prix, offres et quotas affichés correspondent à l'état documenté à cette date. Ils peuvent évoluer ; consulte la source officielle citée sur la page avant achat.
- Poids open-weight · 0 $
- Modèles téléchargeables et auto-hébergeables.
- Licence Meta
- Usage commercial permis, avec restrictions et politique d'usage acceptable.
- Positionnement
- Plus permissif qu'une API fermée, moins qu'Apache 2.0.
- Via des fournisseurs
- Aussi accessible en API chez des hébergeurs tiers, facturée à l'usage.
Licence et capacités annoncées par Meta. La licence open-weight autorise l'usage commercial dans les limites de la politique d'usage acceptable de Meta. Vérifie les termes officiels avant de t'engager.
07 Quand le choisir
Llama n'est pas le meilleur partout. Il brille sur un usage précis.
- Tu veux l'écosystème open-weight le plus déployé, avec beaucoup d'outils autour.
- Tu fais de l'auto-hébergement et tu veux garder la main sur les poids.
- Tu as besoin de personnaliser ou fine-tuner un modèle pour ton usage.
- Tu veux un long contexte sur un seul GPU haut de gamme (Scout, 10 M tokens).
08 Alternatives
Aucun modèle n'est le meilleur partout. Le bon choix dépend de ton besoin.
Qwen
La famille ouverte d'Alibaba, cœur Apache 2.0 et multilingue. Autre choix pour l'auto-hébergement.
Recherche sourcéePerplexity
Un moteur de réponse qui cite ses sources. Autre approche que le modèle brut à héberger.
Grand écosystèmeGemini
Le modèle de Google, fermé mais très intégré. À comparer selon ton écosystème.
09 Verdict
Llama reste l'écosystème open-weight le plus outillé, et Scout tient un record que personne n'approche : dix millions de tokens de contexte. Le mot « ouvert » demande pourtant d'être lu de près. La licence n'est ni Apache 2.0 ni MIT, c'est un contrat : au-delà de 700 millions d'utilisateurs actifs mensuels il faut demander l'autorisation à Meta, tout produit doit afficher « Built with Llama », et tout modèle dérivé doit porter « Llama » dans son nom. Deux autres réserves : Behemoth n'est jamais sorti, et l'annonce qui documente cette génération date du 5 avril 2025.
- Écosystème ouvert le plus déployé : son point fort.
- MoE, long contexte, personnalisation.
- À anticiper : une licence contractuelle, un seuil à 700 millions d'utilisateurs, et Behemoth jamais sorti.
10 Questions fréquentes
Llama, c'est quoi ?
La famille de modèles ouverts de Meta. La génération actuelle est Llama 4 (5 avril 2025), la première en architecture Mixture-of-Experts, avec les variantes Scout et Maverick, et Behemoth encore en preview.
Quelle est la dernière version ?
La génération actuelle est Llama 4, annoncée le 5 avril 2025 par Meta. Behemoth est encore en preview et en entraînement mi-2026, il ne faut donc pas le présenter comme sorti.
Llama est-il gratuit et open source ?
Les modèles sont téléchargeables et auto-hébergeables. La licence est dite « open-weight » : usage commercial permis mais avec restrictions et politique d'usage acceptable de Meta, donc plus permissive qu'une API fermée mais moins qu'Apache 2.0.
Scout ou Maverick ?
Selon Meta, Scout tient sur un seul GPU haut de gamme avec un contexte de 10 M tokens. Maverick compte 17 Md de paramètres actifs sur 128 experts (400 Md au total) et se plaçait au lancement au-dessus de GPT-4o et Gemini 2.0 Flash sur MMLU, MATH et la compréhension d'image.
Variantes, capacités et licence annoncées par Meta. Référence : ai.meta.com · Llama 4.
Choisis le bon LLM
Compare Llama aux autres modèles, ou apprends à écrire un prompt qui va droit au but.