it's free*.ai

目錄 · 核實於 2 Sep 2026

在自己的電腦上執行 AI 模型

沒有要擔心的速率限制、沒有要輪替的金鑰、沒有任何資料離開筆電 —— 唯一的天花板是你的硬體。這些執行環境值得一認,從一行指令的 CLI 到正式環境真正在用的伺服器。

按形態選,而不是按效能:想一分鐘內跑起來選 Ollama,不想碰終端機選 LM Studio,M 系列 Mac 用 MLX,要對外提供服務用 vLLM。

Ollama

CLI + 伺服器

一個指令,模型就在你機器上跑起來。無限制、無配額。

localhost:11434/v1

LM Studio

桌面應用

有圖形介面的 Ollama:探索、下載、本機對話。

localhost:1234/v1

llama.cpp

推論引擎

幾乎所有本機工具底層執行的引擎。純 C++,零依賴。

localhost:8080/v1

Jan

桌面應用

100% 離線運作的開源 ChatGPT 替代品。

localhost:1337/v1

GPT4All

桌面應用

在本機與你的文件對話,資料從不離開筆電。

Local RAG

vLLM

推論伺服器

正式環境真正在用的推論伺服器。PagedAttention 與連續批次處理,跑在你自己的 GPU 上。

localhost:8000/v1

MLX

Apple 晶片

Apple 的陣列運算框架。在 M 系列 Mac 上是本機跑模型最快的方式。

localhost:8080/v1

llamafile

單一執行檔

一個檔案同時是模型和執行環境。下載、chmod +x、執行,完全免安裝。

localhost:8080/v1

KoboldCpp

單一執行檔

包著 llama.cpp 的單一執行檔,為長文與創意寫作調校。

GGUF

關於這些執行環境的常見問題

需要多少記憶體?

量化到 4-bit 的 7B 模型約佔 5 GB,8 GB 記憶體就能從容執行;70B 模型要 40 GB 以上。Can I Run AI 會為你的機器具體評分。

本機模型比得上免費 API 嗎?

通常比不上。家裡能跑的模型比 NVIDIA 或 Groq 免費提供的小。本機的優勢在隱私、離線,以及完全沒有限制。

換個角度看