Ollama
CLI + serveurUne commande et le modèle tourne sur votre machine. Aucune limite, aucun quota.
localhost:11434/v1
Annuaire · vérifié 2 Sep 2026
Aucune limite de débit à heurter, aucune clé à faire pivoter, rien ne quitte l’ordinateur — le seul plafond, c’est votre matériel. Voici les exécutions à connaître, d’un CLI d’une ligne au serveur que la production utilise réellement.
Choisissez par la forme plutôt que par le benchmark : Ollama si vous le voulez fonctionnel en une minute, LM Studio si vous préférez ne pas toucher à un terminal, MLX sur un Mac M-series, vLLM quand vous servez d’autres personnes.
Une commande et le modèle tourne sur votre machine. Aucune limite, aucun quota.
localhost:11434/v1
Ollama avec interface : découvrir, télécharger et discuter en local.
localhost:1234/v1
Le moteur sur lequel tourne presque tout le reste. C++ pur, sans dépendances.
localhost:8080/v1
Alternative open source à ChatGPT qui fonctionne à 100 % hors ligne.
localhost:1337/v1
Discutez avec vos documents en local, rien ne quitte le portable.
Local RAG
Le serveur d’inférence qu’utilise la production. PagedAttention et batching continu, sur votre propre GPU.
localhost:8000/v1
Le framework matriciel d’Apple. Sur un Mac à puce M, c’est la voie la plus rapide en local.
localhost:8080/v1
Un seul fichier qui vaut à la fois modèle et runtime. Téléchargez, chmod +x, exécutez. Aucune installation.
localhost:8080/v1
Un exécutable unique autour de llama.cpp, réglé pour les longs textes et l’écriture créative.
GGUF
Un modèle 7B quantifié en 4 bits tient dans environ 5 Go, donc 8 Go de RAM en font tourner un confortablement. Les modèles 70B veulent 40 Go ou plus. Can I Run AI évaluera votre machine précise.
Pas en général. Les modèles que vous exécutez chez vous sont plus petits que ceux que NVIDIA ou Groq servent gratuitement. Le local gagne en confidentialité, en usage hors ligne et en l’absence totale de limites.