Ollama
CLI + ServerEin Befehl, und das Modell läuft auf deinem Rechner. Keine Limits, keine Quotas.
localhost:11434/v1
Verzeichnis · geprüft 2 Sep 2026
Keine Ratengrenze, kein Schlüssel, nichts verlässt das Gerät — die einzige Obergrenze ist Ihre Hardware. Das sind die Laufzeiten, die man kennen sollte, von einer Ein-Zeilen-CLI bis zum Server, den die Produktion tatsächlich nutzt.
Wählen Sie nach Form statt nach Benchmark: Ollama, wenn Sie in einer Minute startklar sein wollen, LM Studio, wenn Sie kein Terminal anfassen wollen, MLX auf einem M-Series-Mac, vLLM, wenn Sie für andere ausliefern.
Ein Befehl, und das Modell läuft auf deinem Rechner. Keine Limits, keine Quotas.
localhost:11434/v1
Ollama mit GUI: finden, laden und lokal chatten.
localhost:1234/v1
Die Engine, auf der fast alles andere läuft. Pures C++, keine Abhängigkeiten.
localhost:8080/v1
Open-Source-ChatGPT-Alternative, die zu 100 % offline funktioniert.
localhost:1337/v1
Lokal mit deinen Dokumenten chatten — nichts verlässt den Laptop.
Local RAG
Der Serving-Stack der Produktion. PagedAttention und Continuous Batching auf deiner eigenen GPU.
localhost:8000/v1
Apples Array-Framework. Auf einem M-Series-Mac der schnellste Weg zu lokalen Modellen.
localhost:8080/v1
Eine Datei ist Modell und Laufzeit zugleich. Herunterladen, chmod +x, starten. Keine Installation.
localhost:8080/v1
Eine einzelne Binärdatei um llama.cpp, abgestimmt auf lange Texte und kreatives Schreiben.
GGUF
Ein 7B-Modell mit 4-Bit-Quantisierung passt in etwa 5 GB, 8 GB RAM reichen also bequem. 70B-Modelle wollen 40 GB oder mehr. Can I Run AI bewertet Ihren konkreten Rechner.
Meist nicht. Die Modelle zu Hause sind kleiner als die, die NVIDIA oder Groq gratis anbieten. Lokal gewinnt bei Privatsphäre, Offline-Nutzung und gar keinen Limits.