一行命令 在本地拉起大模型,被 200万+ 开发者用来跑推理,靠 4-bit 量化 把 70B 模型压进 48GB 显存门槛,带来 数据不出本机 的隐私保障——让 Llama、DeepSeek、Qwen 在笔记本风扇安静地跑起来,不用再买 API、不担心泄密。

本地 LLM 运行时 · CPU/GPU 自动调度 · 4-bit 量化 · REST + OpenAI 兼容 · Windows / macOS

一行命令跑大模型,零配置

不用 Docker、不用 conda、不用编译——ollama run llama3.1 自动拉模型、量化、加载、起服务,首次约 4.7G 下载,之后秒进对话;REST :11434 直接 curl,OpenAI 兼容层让现有代码改个 base_url 就跑。

CPU/GPU 自动调度

检测到 NVIDIA/AMD/Apple Silicon 自动走 GPU,没卡就回落 CPU+AVX;层可指定 num_gpu 卸载,老本也能跑 7B,不 OOM 不手动调。

4-bit 量化 · 低显存

Q4_K_M/GGUF 量化,7B 仅 4.4G、14B 约 9G、70B 也能压进 48G;比 FP16 省一半显存,4090/4060 甚至 M2 都舒服跑中等模型,不买云。

全模型库 · 一键换

Llama、DeepSeek、Qwen、Mistral、Gemma、Phi 全收录,ollama pull 即下即用;Modelfile 自定义系统提示词、温度、上下文,秒切模型像换标签页。

数据不出本机 · 隐私推理

所有计算在本地完成,敏感合同/病历/代码不上云;配合企业内网部署,满足金融医疗数据合规,再也不用担心 API 厂商留日志或泄密。

API太贵

合同总结不再烧API额度,本地秒出还保密

我每天要总结几十份合同,OpenAI API月账单破千还怕泄密。装Ollama跑DeepSeek-R1本地后,拖PDF就出摘要,敏感条款不出内网,成本归零、速度反而更快。

Ollama — Local Inference Cloud API (old) $0.06/1k tok · 隐私风险 $1.2k/mo · 30s delay Ollama Local $0 · data stays local 38 tok/s · <2s first PDF → "总结5条核心条款" 1. 付款节点:Q1 30% / Q2 40%… 2. 违约条款:逾期0.05%/天… GPU 9.8G · VRAM OK · no network
Docker绕晕

不用Docker/conda,装完一行就进对话

他试过vLLM+Docker部署Qwen,环境冲突搞三天。Ollama下载安装包双击装完,终端敲 ollama run qwen2.5:7b 自动拉模型进对话,新人半小时上手,再不用维护容器。

Terminal — Quick Start # 安装后第一次 $ ollama run qwen2.5:7b pulling manifest pulling 4.7G params… 62% verifying sha256 ✓ loading model · Q4_K_M > 用一句话解释Transformer 自注意力机制让每个词… no docker · no conda · 30min REST :11434 ready
显存不够

4060笔记本跑14B模型,Q4量化不OOM

她只有8G显存4060本,想跑14B总OOM。Ollama默认Q4_K_M量化后模型9G,自动把一半层放GPU、一半放CPU RAM,38 tok/s不卡,写论文查资料比网页AI快还离线。

VRAM Split — 14B Q4 GPU (RTX 4060 8G) layers 24/40 · 6.2G 28 tok/s RAM (系统内存) layers 16/40 · 3.0G 10 tok/s offload Total: 38 tok/s · 9.2G model No OOM · auto layer split vs FP16 need 28G → Q4 = 9G 8G card runs 14B ✓
换模型麻烦

Modelfile自定义提示词,秒切DeepSeek/Qwen

我做客服机器人要A/B不同模型,以前重装环境半天。Ollama写Modelfile指定基础模型+系统提示词+温度,ollama create秒建新模型,客服切DeepSeek、写作切Qwen,零停机。

Modelfile — Custom Bot # Modelfile FROM deepseek-r1:14b SYSTEM "你是客服助手…" PARAM temperature 0.3 PARAM num_ctx 8192 $ ollama create客服v1 Models 客服v1 (DeepSeek) 写作v2 (Qwen2.5) 代码v1 (Llama3.1) 切换 <1s A/B test · zero downtime 客服→DeepSeek · 写作→Qwen

开发者 / 后端

本地起 LLM 服务给代码助手/客服用,OpenAI 兼容改个 URL 就接入,省 API 费用;REST :11434 稳定,CI 里跑模型测试也不用买云实例。

办公 / 法务财务

合同/报表/病历本地总结不泄密,敏感数据不出内网;Q4 量化让 8G 显存本也能跑 14B,比网页 AI 快还离线,合规一次过。

学生 / 研究者

零成本跑开源模型做实验,Modelfile 快速 A/B 不同提示词与温度;Apple Silicon/老 Win 本都能跑 7B,论文写作+代码助手本地全搞定。

Ollama 和直接用 OpenAI API 有啥区别?

API 是按量付费+数据上云,合同/病历这类敏感内容有泄密风险~Ollama 把模型跑在你自己电脑里,一次性下载后零成本无限用,数据完全不出本机;速度靠本地 GPU,不依赖网络,离线也能跑~

Windows / macOS 都支持?Linux 呢?

Win10+/macOS 11+ 都有原生安装包,Apple Silicon 走 Metal 加速~Linux 也有官方脚本一键装;纯 PC 场景完全够,树莓派都能跑 7B 量化版~

8G 显存能跑多大的模型?

Q4_K_M 量化下,7B 约 4.4G、14B 约 9G、32B 约 20G~8G 卡舒服跑 7B 全 GPU、14B 半 GPU 半 RAM 也能 30+ tok/s;70B 需要 48G 显存或纯 CPU 慢跑,选对量化档位就不 OOM~

不会命令行能上手吗?

装完打开终端敲 ollama run 模型名就进对话,和聊天一样~还有 WebUI 社区项目(Open WebUI)套一层网页界面,点选模型、传文件,完全不用记命令,半小时就熟~

怎么和我现有代码对接?

Ollama 自带 OpenAI 兼容层,把 base_url 指向 http://localhost:11434/v1 就行~LangChain、LlamaIndex、Continue 这些框架都原生支持,改一行配置就切到本地模型,不用重写逻辑~

模型从哪下?会不会有恶意模型?

默认从官方库(library.ollama.com)拉,Llama/DeepSeek/Qwen 都是原厂权重量化~也可指定 HuggingFace GGUF 文件本地加载;建议只跑知名模型、校验 sha256,别随便跑来路不明的 .gguf~

"每天总结几十份合同,OpenAI API月账单破千还怕泄密。装Ollama跑DeepSeek-R1本地后,拖PDF就出摘要,敏感条款不出内网,成本归零、38 tok/s比API还快,法务部终于放心。"

@老周 · 法务 / Win工作站

"试过vLLM+Docker部署Qwen环境冲突搞三天。Ollama双击装完,终端敲一行自动拉模型进对话,新人半小时上手;Modelfile秒建客服/写作不同模型,A/B零停机。"

@阿楷 · 后端开发 / Mac

"只有8G显存4060本想跑14B总OOM。Ollama默认Q4量化后9G,自动半层GPU半RAM,38 tok/s不卡,写论文查资料离线也能用,比网页AI快还不要钱。"

@Mia · 研究生 / Win本
前往下载页面 →