llama.cpp、vLLM、LM Studio:它们解决的根本不是同一个问题
本地部署圈里这三个名字出现频率最高,也最常被混着比。但只要读一遍它们各自的官方描述就会发现:它们根本不在同一条赛道上。
一、官方自我定位
二、逐个看官方原话
llama.cpp
官方仓库的一句话定位是 “LLM inference in C/C++”,目标写得很明确:“to enable LLM (and VLM) inference with minimal setup and state-of-the-art performance on a wide range of hardware – locally and in the cloud.”——用最少的配置,在广泛的硬件上实现顶尖性能,本地和云端都行。
关键词是 minimal setup 和 wide range of hardware。这解释了为什么它能在各种奇怪的设备上跑起来——它就是为这个设计的。
vLLM
官方描述是”快速易用的 LLM 推理与服务库”、”高吞吐、内存高效的推理与服务引擎”。核心技术包括 PagedAttention、continuous batching、chunked prefill / prefix caching,以及张量并行、流水线并行、数据并行等分布式推理能力。量化支持 FP8 / INT8 / INT4 / GPTQ / AWQ / GGUF。项目源自 UC Berkeley Sky Computing Lab。
注意 serving 这个词,以及 continuous batching、分布式并行这些特性——它们都是为”很多人同时用”设计的。一个人本地对话,这些能力完全用不上。
LM Studio
官网当前主打 “Bionic is LM Studio’s agent for open models”,宣传语强调可以”用本地或前沿开源模型创建文档、幻灯片、PDF 和软件”。定价页:Free $0,包含 Bionic Agent、通过 llama.cpp 与 MLX 在本地跑模型、离线语音转写、联网搜索、LM Link 最多 5 台设备;另有按量付费的云端 credits;”Bionic Pass” 标注为 Coming soon。
特别留意这一句:它本地跑模型走的就是 llama.cpp。所以”LM Studio 和 llama.cpp 哪个好”这个问题本身就问错了——前者是后者的一层外壳。
三、该选哪个
四、三个常见误解
- “vLLM 更快,所以更好”——vLLM 的快指的是吞吐量,也就是同时服务很多请求时的总处理量。单人单请求的延迟未必更优,而且它对硬件和环境的要求高得多。
- “LM Studio 是玩具”——它本地推理用的就是 llama.cpp 和 MLX,是同一套底层。差别在界面和易用性,不在推理质量。
- “选一个就够了”——完全可以并存。个人用 LM Studio 日常聊,需要压榨性能时直接调 llama.cpp,要给别人提供服务时再上 vLLM。
五、决策路径
本文未核实的部分:LM Studio 的许可条款(个人 / 商用是否均免费)——其文档页只返回了元数据,正文没取到。如果你要商用,务必自己去官网确认许可,不要因为定价页写了 $0 就默认可以商用。
本文事实来源
下列结论均来自官方页面,核实日期 2026-08-12。厂商页面随时会改,看到本文超过三个月未复核时,请以官方页面为准。
- llama.cpp 官方仓库 — https://github.com/ggml-org/llama.cpp
- vLLM 官方仓库 — https://github.com/vllm-project/vllm
- LM Studio 官网 — https://lmstudio.ai/
- LM Studio 官方定价页 — https://lmstudio.ai/pricing