01WHAT IT SOLVES
这个项目解决什么问题?
llama.cpp 是基于 ggml 张量库构建的纯 C/C++ 推理引擎,定位为轻量、可移植、性能领先的开源本地 LLM 与 VLM 推理方案。它通过自研的低比特整数量化、CPU 加速指令集与多后端 GPU 内核,在 Apple Silicon、x86、RISC-V、NVIDIA、AMD、Intel、华为昇腾、摩尔线程等多种硬件上提供一致的推理路径,并内置 llama-server REST 接口与简易 Web UI。它填补了 Python 推理栈与高层封装工具之间的中间层位置,承担被集成与定制的基础设施角色,是许多本地大模型工具的核心推理实现。
02CORE CAPABILITIES
核心能力
纯 C/C++ 实现与无依赖部署
不依赖 Python 或外部框架,单二进制即可完成本地推理
多硬件后端与指令集优化
支持 Apple Silicon、AVX、CUDA、ROCm、Vulkan、SYCL、RISC-V 等十余种后端
低比特整数量化体系
提供 1.5 至 8 比特量化路径,在保持精度的同时压缩显存与内存占用
CPU+GPU 混合推理
通过部分卸载在总显存不足时仍可运行超出显存容量的模型
内置服务与工具链
提供 llama-server REST 接口、命令行工具、GBNF 文法约束与简易 Web UI
03适合谁
- 想要在本地或离线环境运行大模型的开发者
- 需要私有化部署 LLM 或 VLM 推理服务的产品团队
- 在异构硬件上做推理性能验证的工程与研究人员
- 为下游应用提供推理底座的开源贡献者与集成方
04典型使用场景
- 在苹果笔记本或工作站上本地运行量化大模型做对话与开发调试
- 为企业内网部署无云依赖的 OpenAI 兼容 REST 推理服务
- 在 CPU 或低显存 GPU 上验证 1.5 至 8 比特量化方案
- 在边缘设备、安卓或 RISC-V 板卡上做轻量级模型推理
05为什么值得关注
- 跨硬件后端覆盖最广,硬件路线变更时往往率先受到影响
- 量化方案与内核优化持续推进,直接决定本地推理速度
- 作为多个上层工具的底层引擎,升级会沿依赖链向下游扩散
- 官方构建矩阵活跃,新增平台或 CUDA 版本需留意兼容性
06采用前要注意
- 项目以 C/C++ 源码为主,使用门槛高于纯 Python 推理框架
- 不提供训练能力,仅承担模型推理与基础服务封装
- 高级特性和新模型的支持进度依赖社区 PR 与维护节奏
- 部分后端在某些平台仍处于进行中或受限状态,需要自行验证
07RELEASE INTELLIGENCE
近期版本变化
llama.cpp b10936:中文解读生成中
正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。
llama.cpp b10935:中文解读生成中
正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。
llama.cpp b10934:中文解读生成中
正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。
llama.cpp b10933:中文解读生成中
正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。
llama.cpp b10932:中文解读生成中
正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。
llama.cpp b10931:内置 Web UI 加入缓存
本次更新为 llama-server 提供的 Web UI 增加缓存能力,源自 PR #28802。变更面向在前端交互中希望减少重复请求、提升响应流畅度的本地使用者,属于前端体验改进。是否需要升级取决于你是否使用其内置 UI;纯命令行与 API 用户影响不大。官方说明未提供更多细节。
- Web UI 新增缓存机制
- 变更由 Adrien Gallouët 提交并签名
llama.cpp b10930:服务器下载在到达模型上限时放行
本次更新修复了 llama-server 在达到模型数量上限时仍允许模型下载的逻辑问题,对应 issue #26809 与 PR #28530。变更影响通过 server 接口集中管理多个模型的下游使用者,避免限额判定误阻下载流程,属于后端行为修正,建议服务端使用者关注。官方说明未提供更多细节。
- 修复模型上限相关的下载限制逻辑
- 解决 issue #26809 报告的场景
llama.cpp b10929:为 AMD GCN 架构补充 HIP 配置表
本次更新在 ggml-cuda/HIP 路径中为 AMD GCN 架构添加专用配置表,对应 PR #27841。变更影响在 AMD GPU 上做推理性能调优的开发者,使旧架构显卡能匹配更合适的内核参数,属于底层性能与兼容性微调,普通使用者升级一般即可受益。官方说明未提供更多细节。
- 为 AMD GCN 架构引入专属配置表
- 改进 HIP 后端在旧 AMD GPU 上的适配
llama.cpp b10927:内置 HTTP 库升级到 cpp-httplib 0.56.0
本次更新把 llama-server 所依赖的 cpp-httplib 升级到 0.56.0 版本,对应 PR #28787。变更面向维护者与依赖相同组件的下游项目,通常包含安全修复与稳定性改进。普通终端使用者影响较小,建议跟随官方构建升级。官方说明未提供更多细节。
- 升级 cpp-httplib 到 0.56.0
- 与上游 HTTP 库同步安全与维护更新
llama.cpp b10926:SYCL 后端对不支持的 tq1_0 量化温和失败
本次更新让 SYCL 后端在遇到 tq1_0 量化格式无法支持时优雅降级而非崩溃,对应 PR #28681。变更影响在 Intel GPU 或 SYCL 设备上尝试新量化类型的开发者,可避免运行期异常,属于稳定性修正,使用 Intel GPU 的用户建议关注。官方说明未提供更多细节。
- SYCL 后端对 tq1_0 量化增加优雅失败处理
- 降低 Intel GPU 推理链路上的异常中断风险