01WHAT IT SOLVES
这个项目解决什么问题?
vLLM 是面向大语言模型的高吞吐推理与服务引擎,源自 UC Berkeley Sky Computing Lab。它通过 PagedAttention 显存管理、连续批处理、分块预填、KV 缓存分页与分层卸载、speculative decoding、解耦 prefill/decode/encode 等手段,在单卡与多机集群上提供接近研究前沿的推理性能。在生态中,vLLM 与 Hugging Face Transformers、TGI、SGLang、TensorRT-LLM 并列,是开源社区事实标准的通用推理后端之一,既可作为本地 OpenAI 兼容 API 服务,也常用于多模型路由与高并发在线推理平台。相比追求极致单卡性能或硬件绑定的方案,vLLM 定位是广覆盖:原生支持 200+ 模型架构,覆盖 NVIDIA、AMD、Intel GPU 及 TPU、华为 Ascend、Apple Silicon、Rebellions NP
02CORE CAPABILITIES
核心能力
PagedAttention 与高效调度
基于分页机制管理 attention 的 KV 显存,配合连续批处理、分块预填、prefix caching 提升吞吐与显存利用率
量化与并行策略
支持 FP8、MXFP8、MXFP4、NVFP4、INT8、INT4、GPTQ/AWQ、GGUF、compressed-tensors、ModelOpt、TorchAO 等量化,并提供张量、流水线、数据、专家、上下文多种并行
兼容接口与多硬件后端
提供兼容 OpenAI 与 Anthropic Messages API 的服务和 gRPC 控制平面,覆盖 NVIDIA、AMD、Intel GPU 及 TPU、华为 Ascend、Apple Silicon 等硬件
广泛的模型架构支持
原生支持 200+ Hugging Face 模型,包括稠密 LLM、MoE、混合注意力与状态空间模型、多模态模型、嵌入与分类模型等
推测解码与解耦推理
提供 n-gram、suffix、EAGLE、DFlash 等 speculative decoding 方案,并支持 prefill、decode、encode 的解耦部署
03适合谁
- 在自有或私有化 GPU/NPU 集群上自建大模型推理服务的工程团队
- 需要为多模型或多业务提供统一推理后端的平台开发者
- 用 OpenAI/Anthropic 兼容接口替换或备份云端 API 的应用开发者
- 关注开源模型在通用引擎上性能与可复现性的研究人员
04典型使用场景
- 用 OpenAI/Anthropic 兼容接口在私有化环境替代云端 API 部署开源大模型
- 在多卡多机环境对 DeepSeek V4、Kimi K3、Qwen3.5 等前沿 MoE 或大模型做高吞吐在线推理
- 多模型路由平台为不同业务提供统一推理后端、动态扩缩容与多 LoRA 适配
- 研究团队对比不同模型架构在通用推理引擎上的吞吐、时延与正确性
05为什么值得关注
- 社区活跃,能较早获得 DeepSeek V4、Kimi K3、Qwen3.5 等前沿模型的端到端支持与性能优化
- 模型与硬件覆盖广,适合需要在不同加速器之间迁移或横向选型的团队
- 提供 prefix caching、分层 KV 卸载、解耦推理等面向大规模在线服务的关键能力
- 是开源 LLM 服务的事实标准之一,与 Transformers 及上下游生态兼容良好
06采用前要注意
- 版本迭代极快且常含破坏性变更,运维需持续跟进升级与回归测试
- 对深度学习推理栈、CUDA 与分布式部署有较高门槛,新手上手成本较大
- 不同硬件后端的功能完整度与性能调优程度不一,新特性可能首先只覆盖部分 GPU
- 文档与示例可能滞后于快速演进的功能与新模型支持
07RELEASE INTELLIGENCE
近期版本变化
vllm v0.29.0:Model Runner V2 全面默认并集中优化 Kimi-K3 与 DeepSeek V4
该版本由 277 位贡献者提交 594 次提交,Model Runner V2 成为所有模型的默认执行路径,并新增 CUDA graph 内存自动估算、按 TP 分片采样、prompt embeds、extract_hidden_states 推测解码等能力。模型侧新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、GraniteMoeSWA、NemotronH_Omni_Reasoning_V3、Kimi K3 NVFP4 等。Kimi-K3 与 DeepSeek V4 通过融合 MXFP4 top-k、MegaMoE、稀疏 MLA、自适应 top-k、
- Model Runner V2 设为默认,新增 CUDA graph 内存自动估算与按 TP 分片采样
- 新增 Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA、MoeSWA、NemotronH_Omni、Kimi K3 NVFP4 等模型
- Kimi K3 与 DeepSeek V4 在 kernel 与端到端层面获得多项性能改进
- 推测解码、RL 权重同步、Mamba prefix caching 与 FlashInfer all-reduce 默认开启
vllm v0.28.0:Kimi-K3 与 DeepSeek V4 集中性能优化并引入分层 KV 缓存
该版本由 270 位贡献者提交 584 次提交,重点针对 Kimi-K3 做全栈性能优化,包括 Decode Context Parallel、FlashKDA 融合核、MegaMoE SiTU 激活、GEMM-RS、DSpark 自适应推测预算等,并在 ROCm 上支持 Kimi-K3。DeepSeek V4 完善稀疏 MLA 端到端路径,引入 AMD Quark NVFP4、reasoning-effort 映射与稀疏 top-k 优化,启用 ROCm gfx11 与 gfx950。Model Runner V2 扩展 E/P/D 解耦、权重卸载、多层 MTP;KV 缓存支持磁盘卸载与二级
- Kimi-K3 全栈性能优化:DCP、FlashKDA 融合核、MegaMoE、DSpark 自适应预算
- DeepSeek V4 稀疏 MLA 端到端可用,新增 Quark NVFP4 与 ROCm gfx11/gfx950 支持
- 分层 KV 缓存引入磁盘卸载、二级存储、副本感知与相关指标
- Rust 前端与 gRPC 控制平面落地,多项破坏性变更需谨慎升级
vllm v0.27.1:版本变化解读
vllm 发布了 v0.27.1。当前中文解读尚未完成,请以官方 Release 页面列出的变更和兼容性说明为准。
- 官方 Release 已发布,建议打开来源核对完整变更。
- 自动解读信息不足,升级前应重点查看兼容性与迁移说明。
vllm v0.27.0:一次性完整支持 Kimi K3 并显著提升 DeepSeek-V4 性能
该版本由 242 位贡献者提交 561 次提交,单版本落地 Kimi K3 完整支持栈,包括核心模型文件与 kernel、Python 与 Rust 前端、AttnRes kernel、DeepGEMM、压缩量化检查点、DSpark AR 融合与共享专家可分片选项。新增 Qwen3.5 文本稠密与 MoE 模型、K-EXAONE-2.0-750B-A37B、VaultGemma、jina-embeddings-v5-text-nano 等。PyTorch 升级到 2.13.0 并带动 XPU 与 CPU 同步升级,FlashAttention 4 在 SM100 上加深整合并引入 JIT wa
- 单版本落地 Kimi K3 完整支持栈与核心 kernel
- PyTorch 2.13.0 与 Transformers/Triton 升级,FlashAttention 4 在 SM100 深度整合
- DeepSeek V4 多项 kernel 与端到端优化
- Model Runner V2 扩展到非生成负载,引入弹性 EP、混合模型 P/D 与 Rust gRPC
vllm v0.26.0:新增 Inkling 模型族与分层 KV 缓存卸载能力
该版本由 212 位贡献者提交 411 次提交,全栈支持新的 Inkling 模型族,包括基础建模、分段 CUDA graph、Hopper FA4 相对注意力、MTP=1 推测解码、LoRA 与 ModelOpt NVFP4 量化。DeepSeek-V4 在多厂商侧持续优化,新增专用路由核、fused_topk_bias、ROCm 两阶段压缩器;新增 fp32 lm_head 提升生成头精度。注意力后端支持按 KV cache 组选择与显式滑动窗口。KV 卸载与分层二级存储引入对象存储、副本感知分层、tiering 指标与编码器缓存连接器。Rust 前端补齐多模态视频与音频、原生 vllm-
- 全栈支持 Inkling 模型族与 ModelOpt NVFP4
- DeepSeek-V4 跨厂商性能优化
- KV 卸载与分层二级存储能力成熟
- 新增 head_dtype 用于生成模型 fp32 lm_head
vllm v0.25.1:TorchCodec 与混合精度两处问题修复
v0.25.1 是一个仅两笔提交的小版本,修复两个影响范围不同的缺陷。一是 TorchCodec 在系统缺少 FFmpeg 时会阻塞模型启动(如 Qwen3-VL-2B-Instruct 服务场景),错误已改为运行时延迟抛出;二是 FlashInfer allreduce + RMSNorm + 静态量化融合在 BF16 残差流配 FP32 RMSNorm 权重的混合精度下会输出重复标记等乱码,现已加入 dtype-match 守卫将不兼容图路由到安全路径。建议尽快合入,特别是部署多模态模型或 NVFP4 量化模型的用户。
- 修复 TorchCodec 在缺少系统 FFmpeg 时阻塞启动的问题,错误延后到运行时抛出
- 给 FlashInfer allreduce + RMSNorm + 静态量化融合加入 dtype-match 守卫,避免混合精度下输出乱码
vllm v0.25.0:Model Runner V2 默认启用与 PagedAttention 移除
本版本将 Model Runner V2 设为所有稠密模型的默认执行路径,并移除旧版 PagedAttention 实现;Transformers 建模后端性能追平原生 vLLM,并新增 FP8 MoE 支持。新增 LLaVA-OneVision-2、Unlimited OCR、MOSS-Transcribe-Diarize 等模型,并统一流式工具调用与推理解析引擎,加入 DSpark 与 DFlash 等推测解码草稿器。影响所有自 v0.24 升级的用户,需关注默认执行路径变更与 PagedAttention 移除带来的兼容性。
- Model Runner V2 成为稠密模型默认路径,旧版 PagedAttention 已移除
- Transformers 建模后端性能追平原生 vLLM 并新增 FP8 MoE
- 统一流式解析引擎与 DSpark/DFlash 等新推测解码草稿器
- MiniMax-M3 新增流水线并行与 NVFP4,GLM-5/DeepSeek-V3.2 入库
vllm v0.24.0:MiniMax-M3 全链路支持与 Model Runner V2 能力扩展
本版本正式支持 MiniMax-M3 模型,并完成 DeepSeek-V4 多轮性能优化与 SM120、ROCm、XPU 等多平台扩展;Model Runner V2 开始支持量化模型成为默认并启用 GraniteMoE,同时引入 WideEP 与 DeepEP v2 专家并行;新增流式解析引擎雏形、DiffusionGemma 扩散大模型与 CPU 路径。Rust 前端补齐 API 鉴权、CORS、暂停恢复等接口。影响部署 MiniMax-M3、DeepSeek-V4 的工程团队以及依赖分布式专家并行的用户。
- MiniMax-M3 模型全链路支持
- DeepSeek-V4 在 SM120、ROCm、XPU 等平台扩展
- Model Runner V2 支持量化模型成为默认
- 引入 DeepEP v2 专家并行与流式解析引擎
vllm v0.23.0:DeepSeek-V4 多后端硬化与 Gemma 4 支持
该版本包含 408 次提交,DeepSeek-V4 获得多后端硬化与优化,包括 TRTLLM-gen 注意力内核、XPU 注意力解码路径与 EPLB 支持;Model Runner V2 默认覆盖 Llama 与 Mistral 稠密模型;新增 Gemma 4 Unified 无编码器支持与 Gemma 4 MTP;Transformers v5 兼容性升级;多层级 KV 缓存卸载与统一解析器接口完善。官方说明明确指出本版本尚未正式支持 MiniMax-M3,需使用 vLLM 提供的 M3 部署指南。
- DeepSeek-V4 多后端硬化与优化
- Model Runner V2 覆盖更多稠密模型
- Gemma 4 无编码器支持与 Transformers v5 兼容
- 多层级 KV 缓存卸载框架扩展
vllm v0.22.1:补丁修复 DeepSeek-V4 与多节点 Ray 部署
v0.22.1 是在 v0.22.0 之上仅含 8 项提交的小型补丁版本,主要修复若干回归并补齐少量模型与硬件支持。新增 JetBrains Mellum v2 MoE 代码生成模型支持;DeepSeek-V4 修复 CUTLASS fmin 兼容问题导致的初始化失败;AMD Zen CPU 上 W8A8 与 W4A16 量化线性层改走 zentorch 内核。多节点 Ray 数据并行服务修复 num_api_servers 大于 1 时的确定性挂起;Docker 修复 flashinfer-jit-cache 镜像构建问题;NIXL KV 连接器 wheel 安装被规范化为只保留与镜像 CU
- DeepSeek-V4 初始化失败与多节点 Ray DP 挂起修复
- AMD Zen CPU 上 int8 与 GPTQ 量化线性层走 zentorch 内核
- 新增 Mellum v2 模型支持与镜像构建修复