01WHAT IT SOLVES
这个项目解决什么问题?
LiteLLM 把自己定位为开源 AI 网关与 LLM 运维层,核心采用 Rust 引擎加 Python SDK 的双层结构。它在应用代码和模型供应商之间充当统一出入口,原生支持 OpenAI 调用协议并兼容 Bedrock、Azure、Vertex、Anthropic、vLLM、Nvidia NIM 等数百家供应商,把不同厂商的鉴权、请求格式、错误类型抽象成单一接口。同时内置虚拟密钥、用量统计、Guardrails、负载均衡、回调日志和管理后台,可在团队或组织中作为集中调用层部署,商业版还可获得 SSO、定制集成与 SLA 等能力。在同类网关项目中,它与 Portkey、OpenRouter、Vercel AI Gateway 等并列,但更强调企业级运维、A2A 与 MCP 桥接,而不是单纯的请求转发。
02CORE CAPABILITIES
核心能力
统一 LLM 接口
用 OpenAI 兼容格式调用 100 多家供应商,覆盖对话、嵌入、图像、语音、批处理、重排序等端点
Python SDK 与 Rust 网关
既可作为库直接调用,也可部署为独立 Proxy 服务承载高并发请求
运维与治理能力
提供虚拟密钥、按项目或用户分摊成本、Guardrails、负载均衡与回调日志
A2A 与 MCP 桥接
支持把 LangGraph、Vertex Agent Engine、Azure AI Foundry 等智能体以及 MCP 工具服务器接入统一入口
部署与安全工程化
提供带 cosign 签名的稳定 Docker 镜像、Helm Chart 以及 AWS、GCP 的 Terraform 模块
03适合谁
- 需要在多模型供应商之间统一计费、鉴权与日志的 AI 平台或 ML 团队
- 不想被各家 SDK 绑死、希望一行代码切换模型的后端与应用开发者
- 自建 LLM 代理网关、做多租户用量分摊的中型工程组织
- 需要 OpenAI 兼容入口对接现有应用或上层 Agent 框架的团队
04典型使用场景
- 在企业内部署统一 LLM 调用网关,集中管理多家云厂商与开源模型的鉴权和计费
- 用 OpenAI 格式客户端代码同时测试多家模型,便于做 A/B 与成本对比
- 接入 A2A 智能体框架,通过 Proxy 提供统一的对外调用入口
- 将 MCP 工具服务器注册到网关,配合 Cursor 等 IDE 让任意 LLM 使用工具
05为什么值得关注
- 单一接口覆盖 100 多家模型供应商,省去维护多家 SDK 的成本
- 提供带签名校验的稳定镜像、Helm Chart 与 Terraform 模块,工程化程度较高
- 同时具备网关运维、Guardrails 和 MCP、A2A 桥接,是少见的 LLM Ops 一体化方案
- 已被 Netflix 等大型公司在生产环境采用,开源与商业支持路径都明确
06采用前要注意
- 部署 Proxy 需要 Postgres、Redis 与对象存储等配套组件,运维复杂度高于纯 SDK
- SSO、定制 SLA 等高级能力依赖商业授权,开源版本不包含
- 版本迭代较快、API 与行为变动频繁,需关注稳定版标签和升级影响
- 重点聚焦网关层而非上层 Agent 编排,需要与 LangChain 等框架配合使用
07RELEASE INTELLIGENCE
近期版本变化
LiteLLM v1.102.0-dev.2:网关性能与 Guardrails 修复迭代
1.102 第二个开发版以修复为主,重点优化 MCP 代理日志与鉴权覆盖、Azure AI Foundry 计费规则,新增基于百分位的 TTFT 路由策略,并把每请求的花费计数器合并为单次 Redis 调用以提升吞吐。影响所有使用 Proxy 网关与 MCP 集成的用户,建议升级前关注 Redis 与计费相关变更。
- MCP 代理保留日志与鉴权覆盖,工具调度异常可被记录
- Azure AI 七个 Foundry 模型定价与路由费仅计一次
- 引入基于百分位的 TTFT 路由策略
- 每请求的花费计数合并为一次 Redis 调用以提升吞吐
LiteLLM v1.100.1:稳定分支回移并修复路由重试痕迹
这是 1.100.x 稳定分支的小版本,从稳定线移除了先前回移植入的花费归因变更,并修复路由重试面包屑持续保留每个请求早期历史的问题。主要影响仍在 1.100.x 稳定线上的生产部署,建议升级。
- 1.100.x 稳定分支移除花费归因回滚变更
- 路由重试不再保留每个请求的全部早期痕迹
- 官方说明未提供更多细节
LiteLLM v1.101.0-rc.2:候选版回移植入 MongoDB 与 OTel 改进
1.101 第二个候选版将 MongoDB 边车、OTel 租户级追踪目标、仪表盘依赖与团队管理员回调回移至候选分支,并修复 OTel 鉴权 span 与回调合并。影响候选版升级用户以及依赖 MongoDB、OTel 的运维团队,建议在测试环境验证后再升稳定版。
- 候选分支引入 MongoDB 边车能力
- OTel 支持租户级追踪目标与鉴权 span 合并
- 团队管理员回调与仪表盘依赖回移至 1.101 RC
LiteLLM v1.102.0-dev.1:流式 Guardrails 与 Bedrock 定价扩展
1.102 首个开发版聚焦策略引擎的流式后置 Guardrails 执行,补齐 Bedrock GovCloud 已上线但未计价的模型成本,把 Pi 编程代理接入 CLI,并新增 Azure AI Foundry 的 GPT-6 Astra 价格。影响关注流式安全网关、Bedrock GovCloud 用户以及 Azure Foundry 用户的团队,需要关注的开发线变化。
- 策略引擎支持在流式响应上执行 post_call Guardrails 流水线
- Bedrock GovCloud 已上线但未计价的模型补齐定价
- 新增 lite pi CLI 命令通过 Proxy 运行 Pi 编程代理
- Azure AI Foundry 加入 gpt-6-astra 价格映射
litellm v1.100.0:企业可观测与计费增强
v1.100.0 加入按团队的 New Relic trace 路由、Terraform 团队字段补齐 soft_budget 等、Anthropic thinking 块跨 /v1/messages 后端回传、Databricks 缓存 token 按缓存价计费、Google Interactions API 成本入账,以及多项 UI 暗黑模式、模型提示与密钥详情链接修复。影响做企业可观测、成本核算或多云后端接入的团队;属于常规大版本,建议评估迁移到 1.100.x stable 通道。
- 按团队路由 New Relic trace
- Anthropic thinking 块跨 OpenAI 后端回传
- Databricks 缓存 token 按缓存价计费
- Terraform litellm_team 新增 soft_budget 与标签字段
LiteLLM v1.101.0-rc.1:首个候选版修复大量计费与代理稳定性问题
1.101 首个候选版集中修复 /v1/messages 花费行键、Prisma 子进程超时、向量存储失败、缓存读取、Helm ingress 等多项生产问题,同时补齐 Azure AI Grok-4.6 价格映射并增加 e2e 覆盖。影响所有候选版使用者和关注计费、稳定性的运维人员,建议在测试环境先行验证。
- /v1/messages 花费行键改为客户端实际收到的 msg_ id
- Prisma 子进程超时时整组进程被终止以避免残留
- 向量存储与缓存链路在异常时不再污染主流程
- Azure AI 增加 Grok-4.6 价格映射
litellm v1.101.0-dev.2:多组件稳健性与 Guardrail 收尾
该 dev 版本重点修复 Helm、UI、MCP、Router、Bedrock 流式、成本地图等多组件问题,包括 Helm ingress 路径类型、UI 只读管理员隐藏写操作、MCP tools/list 分页跟随、Router 顺序级 fallback、Slack 按用户日或月花费与异常告警等。影响负责生产部署、Guardrail 编排、限流与告警的团队,是 1.101 候选版的稳定基底。
- Slack 新增按用户日或月花费阈值告警与花费异常检测
- Router 在 anthropic safeguard refusal 时走 /v1/messages fallback
- MCP tools/list 跟随上游分页,并在聚合 REST 列表中按 server 报告结果
- 修复 Helm ingress 路径类型兼容、UI 暗黑主题 token 与 Azure chat schema 顶层组合器
litellm v1.99.1:容器镜像修复 OTel 缓存 token 计量
此版本仅发布 Docker 镜像,无 PyPI 包,基于 1.99.0 修复一项 OpenTelemetry v2 span 缺失缓存 token 计数的问题,原本基于 OTel token 数计算支出的链路会低估 prompt caching 工作负载。影响使用 OpenTelemetry 观测与缓存路由的自托管运维人员,应主动关注。
- 仅容器镜像发布,无 PyPI 包,需通过 Docker 镜像升级
- 修复 OTel v2 span 新增缓存创建与缓存读取 token 计数
- 影响基于 OTel token 数计算 prompt caching 支出的链路
litellm v1.97.1:仅 Docker 镜像的维护性安全更新
仅 Docker 镜像发布,1.97 线维护性补丁,刷新基础镜像与依赖固定版本以清除已知 CVE,不改变 LiteLLM 行为,latest 与 main-stable 标签不移动。影响正在使用 1.97 镜像或关注 CVE 修复的运维需升级;普通用户可继续停留在更新稳定线。官方说明未提供更多细节。
- 仅 Docker 镜像发布,无 PyPI 包
- 刷新依赖固定版本以清除已知 CVE
- latest 与 main-stable 标签未变更
litellm v1.101.0-dev.1:类型清理、OIDC 与 Bedrock 扫描增强
此开发版清理 47 个文件的 Any 类型注解并收紧类型检查门槛,新增 OpenAI 工作负载身份联合(OIDC)与 /v1/responses/input_tokens 计数端点;Bedrock 流式 Guardrail 缓冲采样可配置,MongoDB 向量库依赖补齐。影响关注类型质量、企业身份集成与 Bedrock 流的用户,建议关注升级。
- 替换 47 个文件的 Any 类型注解,类型检查门槛收紧
- 新增 OIDC 工作负载身份联合、/v1/responses/input_tokens 计数端点
- Bedrock 流式 Guardrail 缓冲采样可配、Mongo 向量库依赖补齐
- 修复多项代理日志、Bedrock inferenceConfig、Guardrails 文件超时问题