← 返回项目库

ggml-org/llama.cpp

llama.cpp:本地跨硬件大模型推理引擎

它解决在不依赖复杂框架与云端的前提下,在个人电脑、服务器乃至移动设备上高效运行大语言模型与视觉语言模型的问题。适合需要在本地或私有环境中部署模型推理的开发者、研究人员和产品团队。主要门槛是需要自行选择量化方案、编译源码或下载对应硬件的二进制,并具备一定的 C/C++ 编译与模型格式基础知识。

官方名称:llama.cpp资料更新:2026/9/12
打开 GitHub
Stars
12.8万
7日增长
+842
Forks
2.3万
活跃度
100
维护状态
活跃

01WHAT IT SOLVES

这个项目解决什么问题?

llama.cpp 是基于 ggml 张量库构建的纯 C/C++ 推理引擎,定位为轻量、可移植、性能领先的开源本地 LLM 与 VLM 推理方案。它通过自研的低比特整数量化、CPU 加速指令集与多后端 GPU 内核,在 Apple Silicon、x86、RISC-V、NVIDIA、AMD、Intel、华为昇腾、摩尔线程等多种硬件上提供一致的推理路径,并内置 llama-server REST 接口与简易 Web UI。它填补了 Python 推理栈与高层封装工具之间的中间层位置,承担被集成与定制的基础设施角色,是许多本地大模型工具的核心推理实现。

02CORE CAPABILITIES

核心能力

01

纯 C/C++ 实现与无依赖部署

不依赖 Python 或外部框架,单二进制即可完成本地推理

02

多硬件后端与指令集优化

支持 Apple Silicon、AVX、CUDA、ROCm、Vulkan、SYCL、RISC-V 等十余种后端

03

低比特整数量化体系

提供 1.5 至 8 比特量化路径,在保持精度的同时压缩显存与内存占用

04

CPU+GPU 混合推理

通过部分卸载在总显存不足时仍可运行超出显存容量的模型

05

内置服务与工具链

提供 llama-server REST 接口、命令行工具、GBNF 文法约束与简易 Web UI

03适合谁

  • 想要在本地或离线环境运行大模型的开发者
  • 需要私有化部署 LLM 或 VLM 推理服务的产品团队
  • 在异构硬件上做推理性能验证的工程与研究人员
  • 为下游应用提供推理底座的开源贡献者与集成方

04典型使用场景

  • 在苹果笔记本或工作站上本地运行量化大模型做对话与开发调试
  • 为企业内网部署无云依赖的 OpenAI 兼容 REST 推理服务
  • 在 CPU 或低显存 GPU 上验证 1.5 至 8 比特量化方案
  • 在边缘设备、安卓或 RISC-V 板卡上做轻量级模型推理

05为什么值得关注

  • 跨硬件后端覆盖最广,硬件路线变更时往往率先受到影响
  • 量化方案与内核优化持续推进,直接决定本地推理速度
  • 作为多个上层工具的底层引擎,升级会沿依赖链向下游扩散
  • 官方构建矩阵活跃,新增平台或 CUDA 版本需留意兼容性

06采用前要注意

  • 项目以 C/C++ 源码为主,使用门槛高于纯 Python 推理框架
  • 不提供训练能力,仅承担模型推理与基础服务封装
  • 高级特性和新模型的支持进度依赖社区 PR 与维护节奏
  • 部分后端在某些平台仍处于进行中或受限状态,需要自行验证

07RELEASE INTELLIGENCE

近期版本变化

全部版本动态 →

llama.cpp b10936:中文解读生成中

正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。

llama.cpp b10935:中文解读生成中

正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。

llama.cpp b10934:中文解读生成中

正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。

llama.cpp b10933:中文解读生成中

正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。

llama.cpp b10932:中文解读生成中

正在根据官方 Release 说明生成中文变化摘要,请暂时以来源页面为准。

llama.cpp b10931:内置 Web UI 加入缓存

本次更新为 llama-server 提供的 Web UI 增加缓存能力,源自 PR #28802。变更面向在前端交互中希望减少重复请求、提升响应流畅度的本地使用者,属于前端体验改进。是否需要升级取决于你是否使用其内置 UI;纯命令行与 API 用户影响不大。官方说明未提供更多细节。

  • Web UI 新增缓存机制
  • 变更由 Adrien Gallouët 提交并签名

llama.cpp b10930:服务器下载在到达模型上限时放行

本次更新修复了 llama-server 在达到模型数量上限时仍允许模型下载的逻辑问题,对应 issue #26809 与 PR #28530。变更影响通过 server 接口集中管理多个模型的下游使用者,避免限额判定误阻下载流程,属于后端行为修正,建议服务端使用者关注。官方说明未提供更多细节。

  • 修复模型上限相关的下载限制逻辑
  • 解决 issue #26809 报告的场景

llama.cpp b10929:为 AMD GCN 架构补充 HIP 配置表

本次更新在 ggml-cuda/HIP 路径中为 AMD GCN 架构添加专用配置表,对应 PR #27841。变更影响在 AMD GPU 上做推理性能调优的开发者,使旧架构显卡能匹配更合适的内核参数,属于底层性能与兼容性微调,普通使用者升级一般即可受益。官方说明未提供更多细节。

  • 为 AMD GCN 架构引入专属配置表
  • 改进 HIP 后端在旧 AMD GPU 上的适配

llama.cpp b10927:内置 HTTP 库升级到 cpp-httplib 0.56.0

本次更新把 llama-server 所依赖的 cpp-httplib 升级到 0.56.0 版本,对应 PR #28787。变更面向维护者与依赖相同组件的下游项目,通常包含安全修复与稳定性改进。普通终端使用者影响较小,建议跟随官方构建升级。官方说明未提供更多细节。

  • 升级 cpp-httplib 到 0.56.0
  • 与上游 HTTP 库同步安全与维护更新

llama.cpp b10926:SYCL 后端对不支持的 tq1_0 量化温和失败

本次更新让 SYCL 后端在遇到 tq1_0 量化格式无法支持时优雅降级而非崩溃,对应 PR #28681。变更影响在 Intel GPU 或 SYCL 设备上尝试新量化类型的开发者,可避免运行期异常,属于稳定性修正,使用 Intel GPU 的用户建议关注。官方说明未提供更多细节。

  • SYCL 后端对 tq1_0 量化增加优雅失败处理
  • 降低 Intel GPU 推理链路上的异常中断风险