首页 / 开源 · 本地跑模型 / 自部署 / llama.cpp
⚙️

llama.cpp

ggml-org
⭐ 119k开源免费

底层推理引擎,普通电脑甚至手机都能跑大模型。

它能帮你做什么

解读

llama.cpp 是让大模型能在普通电脑、甚至手机上高效运行的底层引擎——你熟悉的 Ollama、很多本地 AI 工具,底层其实都在用它。

它的强项是「榨硬件」:通过量化技术,让原本要高端显卡才能跑的模型,在你的旧电脑、甚至手机上也能跑起来。

坦白讲,它偏底层、偏折腾。如果你只是想简单在本地用 AI,直接用 Ollama 就行(它已经把 llama.cpp 的麻烦全帮你封装好了)。这一页更适合想深入理解、追求性能的进阶玩家。

适合谁

偏进阶折腾党——想深入理解、追求性能、或在低配 / 特殊设备上跑模型的人。只想简单用的小白请直接用 Ollama(它底层就是 llama.cpp,帮你省了所有麻烦)。

开始前的准备

手把手教程

  1. 安装:Mac 直接 brew install llama.cpp;Windows/Linux 从 GitHub Releases 下预编译包,或自己编译。
  2. 下模型:下载一个 gguf 格式的模型文件(国内去「魔搭 ModelScope」搜 gguf)。
  3. 跑对话:运行 llama-cli -m 模型文件路径 -p "用一句话介绍杭州"
  4. (可选)开服务:运行 llama-server -m 模型路径,得到一个本地 API,别的软件可以接。

常见问题 / 踩坑

和 Ollama 什么关系?
Ollama 底层就用了 llama.cpp。想省心用 Ollama;想自己控制细节、榨性能才直接用 llama.cpp。
gguf 是什么?
一种为本地高效运行而优化(量化)的模型文件格式。文件名里的 Q4、Q8 表示量化精度,越大越准但越占资源。
手机真能跑?
能跑小模型(如 1B/3B),有相应 App 封装。别期待它有大模型的效果。
感觉太难了?
那就用 Ollama,一条命令搞定,效果一样,完全不用碰这些底层。

进阶技巧

打不开 GitHub / 国内访问

模型优先从国内「魔搭 ModelScope」下载 gguf,比 HuggingFace 快很多;Mac 用 brew install llama.cpp 最省事,全程可不必碰 GitHub。

同类还有

← 返回全部工具