01WHAT IT SOLVES
这个项目解决什么问题?
Ollama 定位为本地优先的开源大模型运行平台,底层依赖 llama.cpp 等高性能推理后端,提供 macOS、Windows、Linux 与 Docker 多端安装。它以统一 CLI 与 REST API 暴露模型管理、对话和嵌入等能力,并维护官方模型库以简化权重拉取与版本切换。在同类方案中,它不是从零训练的框架,更接近 vLLM、LM Studio 等本地推理运行时的开源代表,差异在于跨平台安装体验、官方应用客户端以及围绕它形成的大量社区生态,包括 WebUI、桌面客户端、IDE 插件、Agent 框架和 RAG 工具等。
02CORE CAPABILITIES
核心能力
跨平台一键安装与启动
提供 macOS、Windows、Linux 桌面端与 Docker 镜像,简化本地推理环境搭建
统一模型管理与 CLI
通过命令行即可拉取、删除、切换和运行 ollama 库中的开源模型
REST API 与多语言 SDK
暴露 OpenAI 兼容接口,并提供官方 Python、JavaScript 客户端
多后端推理支持
集成 llama.cpp、MLX 等推理后端,自动适配不同硬件平台
生态集成丰富
可作为 Claude Desktop、IDE 插件、RAG、Agent 等工具的后端推理源
03适合谁
- 希望在本地或私有环境运行开源大模型的开发者
- 集成大模型到自有应用的产品与后端工程师
- 评估不同开源模型能力的研究者与数据团队
- 追求数据不出端的个人用户与小团队
04典型使用场景
- 在本地一键拉取并试用 DeepSeek、Qwen、Gemma 等开源模型
- 通过 REST API 或 Python/JS SDK 将本地模型接入应用
- 作为 Claude Desktop、VS Code 等工具的后端推理源
- 搭建私有 RAG、Agent 或聊天机器人原型
05为什么值得关注
- 跨平台安装体验成熟,社区生态覆盖 WebUI、桌面端与 IDE
- 持续跟进主流开源模型权重与 llama.cpp、MLX 后端升级
- 提供官方应用客户端,降低非命令行用户使用门槛
- 兼容 OpenAI 风格接口,便于在多端切换推理后端
06采用前要注意
- 推理性能与并发能力受限于本地硬件与后端实现
- 模型文件体积大,首次下载与存储成本较高
- 仍处于较活跃迭代,API 与 CLI 行为可能随版本变化
- 安全、鉴权与多租户能力需自行在上层补充
07RELEASE INTELLIGENCE
近期版本变化
Ollama v0.34.0:在 ChatGPT 桌面端直接使用本地开源模型
该版本让用户在 ChatGPT Desktop 中直接选用 Ollama 管理的本地模型,保留原有桌面端工作流的同时运行开源权重。官方说明未提供更多细节,硬件依赖仍以 macOS 为主,并在 Apple Silicon 上提升结构化输出性能,同时加入 OpenAI 兼容的客户端工具搜索与响应压缩支持。
- 支持在 ChatGPT Desktop 中直接调用 Ollama 本地模型
- 优化 Apple Silicon 上的结构化输出性能
- 增加 OpenAI 兼容的客户端工具搜索能力
Ollama v0.33.3:MLX 引擎扩展多模态与缓存统计
本版本让 gemma4 在 MLX 引擎下支持图像与音频输入,并新增对缓存提示词的 Token 统计,同时尊重 GGUF 模型自带的默认参数。底层 llama.cpp、MLX 与 MLX-C 同步更新,影响使用 Apple Silicon 与自定义 Modelfile 的用户。
- gemma4 在 MLX 引擎下支持图像与音频
- 新增对缓存提示词的 Token 报告
- 遵循 GGUF 模型定义的默认参数
Ollama v0.33.2:修复桌面端外观与多实例冲突
该版本让官方应用重新跟随系统外观,恢复深色模式,并修复 macOS 上重复启动实例导致的问题。Claude Desktop 代理在模型目录更新时不再打断进行中的请求,提升长任务稳定性。
- 桌面端恢复跟随系统外观与深色模式
- 修复 macOS 应用重复启动冲突
- 修复 Claude Desktop 代理被目录更新中断的问题
Ollama v0.33.1:MLX 新增 Qwen3.8 Flash Next 与结构化输出
该版本在 MLX 引擎上引入对 Qwen3.8 Flash Next 的支持,并在 MLX 推理器中加入结构化输出能力。同步更新 cmake、llama.cpp 与 MLX,并修复慢存储加载模型时的 Metal GPU 超时问题,主要影响 Apple Silicon 用户。
- MLX 引擎支持 Qwen3.8 Flash Next
- MLX 推理器新增结构化输出
- 修复慢存储场景下的 Metal GPU 超时
Ollama v0.33.0:Claude Desktop 接入与缓存机制重写
该版本支持将 Claude Desktop 配置为 Ollama 作为第三方网关服务,并重写预填充缓存逻辑,避免长任务被取消后从零重算。DeepSeek Harness 启动器在 npm 全局安装失败时会回退到 npx,并改进 macOS/Linux/Windows 跨平台默认打包。
- Claude Desktop 支持以 Ollama 为第三方网关
- 重写预填充缓存,取消后支持断点续算
- 修复跨平台默认打包在非 macOS 平台失效的问题
Ollama v0.32.15:首 token 延迟优化与桌面引导升级
此版本通过在请求间缓存已解析的模型元数据,把首 token 时间从约 995 毫秒降至约 524 毫秒,并新增桌面首次启动引导流程,修复流式解析出错后聊天与生成可能卡死的 Bug,同时规范化 Qwen 3.8 的系统消息处理,底层同步更新 MLX 与 llama.cpp。影响桌面端新用户体验、Qwen 3.8 使用者与对响应延迟敏感的应用。无需特别关注,升级即可获得更顺滑体验。
- 缓存模型元数据后首 token 时间约减半
- 桌面首次启动新增引导流程
- 修复流式解析错误后聊天与生成卡死的 Bug
- 规范化 Qwen 3.8 系统消息处理
ollama v0.32.14:WebP 图像转码与 Qwen 系统消息兼容
该版本为 llm 模块加入 WebP 图像转码以便通过 llama-server 处理;Qwen 渲染器放宽对非前置系统消息的限制。官方说明未提供更多细节。
- llm 模块支持 WebP 图像转码至 llama-server
- Qwen 渲染器兼容非前置系统消息
ollama v0.32.13:Qwen3.8 模型支持开发者指令
v0.32.13 为 qwen3.8 模型新增对开发者指令的支持。该版本影响在 Ollama 中使用 Qwen3.8 并希望精细化控制模型行为的开发者,可按需升级。
- qwen3.8 模型支持开发者指令
- 官方说明未提供更多细节
ollama v0.32.12:新增 Qwen 3.8 27B 模型支持
本版本正式加入对 Qwen 3.8 27B 的支持,官方介绍称其在编码、专业任务、研究与长链路 Agent 场景有明显提升。Apple Silicon 设备获得了针对性优化,以适合反复调用与编码 Agent 的高质量输出。官方说明未提供更多细节。
- 新增 Qwen 3.8 27B 模型支持
- 在 Apple Silicon 上为反复执行与编码 Agent 场景进行性能与质量优化
ollama v0.32.11:编码代理与 Web 搜索能力扩展
ollama launch dsh 新增 DeepSeek Harness 支持,ollama launch muse 支持 Meta 的 Muse Code 编码 CLI,OpenAI 兼容 Responses API 增加 Web 搜索能力,同时更新 Muse Glimmer 模板,便于把本地模型接入更多编码代理与检索场景。
- ollama launch dsh 支持 DeepSeek Harness
- ollama launch muse 支持 Meta 的 Muse Code 编码 CLI
- OpenAI 兼容 Responses API 新增 Web 搜索能力
- Muse Glimmer 模板更新
COMPARISON PATH
继续对比同类方案
不要只看单页结论;沿同类用途继续比较能力边界、硬件门槛与维护状态。