it's free*.ai

目录 · 核实于 2 Sep 2026

在自己的电脑上运行 AI 模型

没有要担心的速率限制、没有要轮换的密钥、没有任何数据离开笔记本 —— 唯一的天花板是你的硬件。这些运行时值得一认,从一行命令的 CLI 到生产环境真正在用的服务器。

按形态选,而不是按跑分:想一分钟内跑起来选 Ollama,不想碰终端选 LM Studio,M 系列 Mac 用 MLX,要对外提供服务用 vLLM。

Ollama

CLI + 服务器

一条命令,模型就在你机器上跑起来。无限制、无配额。

localhost:11434/v1

LM Studio

桌面应用

带图形界面的 Ollama:发现、下载、本地对话。

localhost:1234/v1

llama.cpp

推理引擎

几乎所有本地工具底层运行的引擎。纯 C++,零依赖。

localhost:8080/v1

Jan

桌面应用

100% 离线工作的开源 ChatGPT 替代品。

localhost:1337/v1

GPT4All

桌面应用

本地与你的文档对话,数据从不离开笔记本。

Local RAG

vLLM

推理服务器

生产环境真正在用的推理服务器。PagedAttention 与连续批处理,跑在你自己的 GPU 上。

localhost:8000/v1

MLX

Apple 芯片

Apple 的数组计算框架。在 M 系列 Mac 上是本地跑模型最快的方式。

localhost:8080/v1

llamafile

单文件可执行

一个文件同时是模型和运行时。下载、chmod +x、运行,完全无需安装。

localhost:8080/v1

KoboldCpp

单文件可执行

包着 llama.cpp 的单文件可执行程序,为长文与创意写作调优。

GGUF

关于这些运行时的常见问题

需要多少内存?

量化到 4-bit 的 7B 模型约占 5 GB,8 GB 内存就能从容运行;70B 模型要 40 GB 以上。Can I Run AI 会为你的机器具体打分。

本地模型比得上免费 API 吗?

通常比不上。家里能跑的模型比 NVIDIA 或 Groq 免费提供的小。本地的优势在隐私、离线,以及完全没有限制。

换个角度看