首页 / 开源 · 本地跑模型 / 自部署 / llama.cpp
⚙️
llama.cpp
ggml-org
底层推理引擎,普通电脑甚至手机都能跑大模型。
它能帮你做什么
- 在普通电脑、老旧设备、甚至手机上高效跑开源大模型
- 追求极致性能和量化,榨干硬件、跑更大的模型
- 给自己的程序当底层推理引擎(很多工具基于它)
- 完全离线、免费地跑模型
解读
llama.cpp 是让大模型能在普通电脑、甚至手机上高效运行的底层引擎——你熟悉的 Ollama、很多本地 AI 工具,底层其实都在用它。
它的强项是「榨硬件」:通过量化技术,让原本要高端显卡才能跑的模型,在你的旧电脑、甚至手机上也能跑起来。
坦白讲,它偏底层、偏折腾。如果你只是想简单在本地用 AI,直接用 Ollama 就行(它已经把 llama.cpp 的麻烦全帮你封装好了)。这一页更适合想深入理解、追求性能的进阶玩家。
适合谁
偏进阶折腾党——想深入理解、追求性能、或在低配 / 特殊设备上跑模型的人。只想简单用的小白请直接用 Ollama(它底层就是 llama.cpp,帮你省了所有麻烦)。
开始前的准备
- 一台电脑(Mac 用 brew 最省事;Windows/Linux 需下预编译包或自己编译)。
- 一个
gguf格式的模型文件。 - 一定的命令行基础。
手把手教程
- 安装:Mac 直接
brew install llama.cpp;Windows/Linux 从 GitHub Releases 下预编译包,或自己编译。 - 下模型:下载一个
gguf格式的模型文件(国内去「魔搭 ModelScope」搜 gguf)。 - 跑对话:运行
llama-cli -m 模型文件路径 -p "用一句话介绍杭州"。 - (可选)开服务:运行
llama-server -m 模型路径,得到一个本地 API,别的软件可以接。
常见问题 / 踩坑
和 Ollama 什么关系?
Ollama 底层就用了 llama.cpp。想省心用 Ollama;想自己控制细节、榨性能才直接用 llama.cpp。
gguf 是什么?
一种为本地高效运行而优化(量化)的模型文件格式。文件名里的 Q4、Q8 表示量化精度,越大越准但越占资源。
手机真能跑?
能跑小模型(如 1B/3B),有相应 App 封装。别期待它有大模型的效果。
感觉太难了?
那就用 Ollama,一条命令搞定,效果一样,完全不用碰这些底层。
进阶技巧
- 量化选择:内存紧张选 Q4 系列,追求质量且内存够选 Q6/Q8。
- 模型从「魔搭 ModelScope」下 gguf,国内速度比 HuggingFace 快很多。
打不开 GitHub / 国内访问
模型优先从国内「魔搭 ModelScope」下载 gguf,比 HuggingFace 快很多;Mac 用
brew install llama.cpp 最省事,全程可不必碰 GitHub。