Fiche outil · IA locale
llama.cpp
llama.cpp est un moteur en C et C++ pour exécuter des modèles sur de nombreux matériels, sans imposer d’interface graphique.
En bref
À choisir pour contrôler finement l’exécution locale et l’API. LM Studio est plus simple au premier lancement, Ollama plus direct pour gérer des modèles.
01 Ce que fait llama.cpp
llama.cpp est un moteur en C et C++ pour exécuter des modèles sur de nombreux matériels, sans imposer d’interface graphique.
02 Capacités vérifiées
- Exécution locale en ligne de commande avec
llama-cli. - Serveur HTTP avec
llama-serveret plusieurs routes de style OpenAI. - Prise en charge de CPU, Metal, CUDA, HIP, Vulkan et d’autres backends selon la compilation.
- Téléchargement direct de fichiers GGUF compatibles depuis Hugging Face.
- Code distribué sous licence MIT.
03 Limites à connaître
- Aucune interface de bureau complète n’est fournie par le moteur.
- Le modèle, sa licence et sa quantification doivent être choisis séparément.
- Les performances dépendent du backend, de la mémoire et des options de compilation.
- Une API de style OpenAI ne garantit pas une compatibilité fonctionnelle totale.
- La documentation suppose davantage d’aisance technique que LM Studio.
04 Accès et versions
- Binaires
- Homebrew, Nix, Winget, Conda, conteneurs et archives selon le système.
- Compilation
- Construction depuis les sources pour choisir le backend matériel.
- Licence
- MIT pour le code ; chaque modèle conserve sa propre licence.
05 Prix et quotas
Relevé tarifaire de juillet 2026. Les montants en dollars restent ceux des grilles officielles internationales.
- Logiciel
- Gratuit à télécharger et utiliser sous licence MIT.
- Coûts réels
- Matériel, stockage et électricité restent à la charge de l’utilisateur.
06 Quand le choisir
- Tu veux intégrer un moteur local dans une application ou un script.
- Tu dois ajuster précisément les paramètres, le backend ou la quantification.
- Tu préfères une brique légère à une application de bureau complète.
07 Sources
Sources primaires consultées le 21 juillet 2026. Les capacités annoncées ne sont pas présentées comme des tests de Monsieur Prompt.
Replacer llama.cpp dans le bon univers
Compare l’outil à ceux qui répondent au même travail avant de choisir un forfait.