Ollama
CLI + サーバーコマンド1つでマシン上でモデルが動く。制限も上限もなし。
localhost:11434/v1
ディレクトリ · 確認日 2 Sep 2026
ぶつかるレート制限も、ローテーションするキーも、ラップトップから送信されるものもなし — 唯一の上限はハードウェアです。1行のCLIから本番で実際に使われるサーバーまで、知っておくべきランタイムです。
ベンチマークより形で選びましょう: 1分で動かしたいならOllama、ターミナルに触りたくないならLM Studio、MシリーズMacならMLX、他の人に配信するならvLLM。
コマンド1つでマシン上でモデルが動く。制限も上限もなし。
localhost:11434/v1
GUI版Ollama:見つけて、ダウンロードして、ローカルでチャット。
localhost:1234/v1
ほぼすべてのローカルツールの土台。ピュアC++、依存なし。
localhost:8080/v1
100%オフラインで動くオープンソースのChatGPT代替。
localhost:1337/v1
ローカルでドキュメントと対話。データはノートPCから出ない。
Local RAG
本番で使われる推論サーバー。PagedAttentionと継続バッチングを自分のGPUで。
localhost:8000/v1
Appleの配列フレームワーク。M系列Macではローカル実行の最速ルート。
localhost:8080/v1
モデルとランタイムが1ファイルに。ダウンロードしてchmod +xして実行。インストール不要。
localhost:8080/v1
llama.cppを包むシングルバイナリ。長文・創作向けに調整済み。
GGUF
4ビット量子化の7Bモデルは約5GBで収まるので、8GBあれば余裕で動きます。70Bは40GB以上必要です。Can I Run AIがあなたのマシンを判定してくれます。
通常は違います。自宅で動かせるモデルはNVIDIAやGroqが無料で提供するものより小さいです。プライバシー・オフライン利用・制限ゼロではローカルが勝ります。