Ollama
CLI + 伺服器一個指令,模型就在你機器上跑起來。無限制、無配額。
localhost:11434/v1
目錄 · 核實於 2 Sep 2026
沒有要擔心的速率限制、沒有要輪替的金鑰、沒有任何資料離開筆電 —— 唯一的天花板是你的硬體。這些執行環境值得一認,從一行指令的 CLI 到正式環境真正在用的伺服器。
按形態選,而不是按效能:想一分鐘內跑起來選 Ollama,不想碰終端機選 LM Studio,M 系列 Mac 用 MLX,要對外提供服務用 vLLM。
一個指令,模型就在你機器上跑起來。無限制、無配額。
localhost:11434/v1
有圖形介面的 Ollama:探索、下載、本機對話。
localhost:1234/v1
幾乎所有本機工具底層執行的引擎。純 C++,零依賴。
localhost:8080/v1
100% 離線運作的開源 ChatGPT 替代品。
localhost:1337/v1
在本機與你的文件對話,資料從不離開筆電。
Local RAG
正式環境真正在用的推論伺服器。PagedAttention 與連續批次處理,跑在你自己的 GPU 上。
localhost:8000/v1
Apple 的陣列運算框架。在 M 系列 Mac 上是本機跑模型最快的方式。
localhost:8080/v1
一個檔案同時是模型和執行環境。下載、chmod +x、執行,完全免安裝。
localhost:8080/v1
包著 llama.cpp 的單一執行檔,為長文與創意寫作調校。
GGUF
量化到 4-bit 的 7B 模型約佔 5 GB,8 GB 記憶體就能從容執行;70B 模型要 40 GB 以上。Can I Run AI 會為你的機器具體評分。
通常比不上。家裡能跑的模型比 NVIDIA 或 Groq 免費提供的小。本機的優勢在隱私、離線,以及完全沒有限制。