
解决什么问题
把 DeepSeek 装进自己电脑,图的是三件事:
- 隐私:合同、内部代码、病历这类文本不出本机,不经过任何第三方服务器;
- 稳定:不受网页版高峰”服务器繁忙”和 API 限流的影响,半夜跑批也不用抢额度;
- 成本:跑批任务零 token 费用,电费之外没有边际成本。
也要先说清两个”不值得”:消费级显卡只能跑蒸馏版,推理能力与满血版有实实在在的差距,重推理任务仍然要用 API;7B 以上的模型对显存有硬要求,硬件不达标体验会很差。所以动手前先看显存表选型号,再决定装不装。
本地与 API 不是二选一,常见分工是:隐私敏感、断网、高频批任务走本地;满血能力、联网时效、移动端随时用走 API 与网页版。接入方式的全景见DeepSeek 获取与使用方式全解。
环境与版本
| 项目 | 要求 |
|---|---|
| 操作系统 | Windows / macOS / Linux 均可 |
| Ollama | 【待补:当前版本号】;安装与国内下载加速见Ollama 安装与国内镜像加速指南 |
| 显卡 | 见下方显存表;无独显也能跑 1.5B(CPU 推理,速度慢) |
| 磁盘 | 量化后的模型权重:7B 级约 4~5 GB,32B 级约 20 GB 上下【待补:装机后实测占用】 |
| 聊天前端(可选) | ChatBox、Open WebUI,不装也能在终端直接聊 |
显存要求:先选型号再动手
DeepSeek 开源的满血 V3(通用对话)与 R1(推理)是 671B 参数的 MoE 模型,家用设备不用考虑。官方同时发布了蒸馏版:基于 Qwen 的 1.5B / 7B / 14B / 32B,加上基于 Llama 的 8B / 70B——消费级硬件瞄准的就是这个系列。Ollama 里的对应 tag 与显存经验值如下:
| Ollama 模型名 | 参数量 | 显存经验值 | 适配硬件参考 |
|---|---|---|---|
| deepseek-r1:1.5b | 1.5B | 约 1~2 GB | 核显、老笔记本、纯 CPU |
| deepseek-r1:7b | 7B | 约 6~8 GB | 8 GB 显存的显卡 |
| deepseek-r1:8b | 8B | 约 6~8 GB | 8 GB 显存的显卡 |
| deepseek-r1:14b | 14B | 约 10~12 GB | 12 GB 显存显卡 |
| deepseek-r1:32b | 32B | 约 20~24 GB | 24 GB 显存显卡 |
| deepseek-r1:70b | 70B | 约 40~48 GB | 双 24 GB 卡或 48 GB 专业卡 |
| 满血 V3 / R1 | 671B | 数百 GB | 多卡服务器或云端,家用免谈 |
经验值的口径:Q4 量级量化权重,加上常用上下文长度的余量。显存占用不止权重一项——KV cache 随上下文长度增长,把 num_ctx 开到几万 tokens 时要另算。动手前用 ollama show 看模型的精确体积,跑起来后用 ollama ps 确认 GPU 分担。各型号在你显卡上的实测速度【待补:实测 tokens/s】。
显存之外:三个决定体验的参数
num_ctx(上下文长度)。Ollama 默认的上下文窗口不大,长文档问答必须调大;但 KV cache 随之膨胀,8 GB 卡上跑 7B 时把 num_ctx 拉满很容易爆显存。经验做法:从 8K 量级起步,按显存余量逐步加。
量化等级。同一参数量有不同量化档位,Q4 档体积最小、速度最快,能力损失可感知但不大;Q8 档更接近原模型,体积约翻倍。Ollama 官方 tag 默认是 Q4 量级,够日常用;对质量敏感再找高量化档(同一模型的多个量化 tag 或社区版本,具体命名以 Ollama 模型页为准)。
温度与采样。官方给 R1 系的建议是温度 0.5~0.7 区间(推荐 0.6 一档),温度过高会让思维链发散;日常问答保持默认即可,跑数学题再按这个区间调。
分步骤:Ollama 跑起来
第 1 步:安装 Ollama 并验证
国内网络下载安装包与模型容易慢或失败,走镜像加速的完整步骤见文末相关阅读。装完先验证:
ollama --version
第 2 步:按显存选型号并拉取
# 8 GB 显存的卡选 7b 或 8b;直接 run 也行,没拉取过会自动先拉
ollama run deepseek-r1:7b
进入对话后随便问一句试手感,/bye 退出。第一次拉模型需要等权重下载完,7B 级约 4~5 GB。
第 3 步:核对 GPU 分担
# PROCESSOR 列显示接近 100% GPU 才是全程显存推理
ollama ps
# 查看模型的精确体积、量化信息
ollama show deepseek-r1:7b
如果 ollama ps 显示 CPU 占比很高,说明显存溢出、部分层被卸载到 CPU,速度会断崖式下降——回到显存表换小一号的模型。
第 4 步:接聊天前端(可选)
ChatBox 里提供方选 Ollama、地址保持默认 http://localhost:11434 即可;Open WebUI 适合自托管成团队入口。程序化调用直接走 Ollama 的 OpenAI 兼容接口:
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-r1:7b",
"messages": [{"role": "user", "content": "写一个快速排序"}]
}'
常见坑
坑一:权重装得下,上下文一开就爆。 显存占用是权重加 KV cache 两部分,把 num_ctx 调大后爆显存,Ollama 会静默把部分层卸到 CPU,表现为”能跑但极慢”。降上下文长度或换小模型,别硬扛。
坑二:把蒸馏版当满血 R1 用。 1.5B~70B 是把 R1 的推理能力蒸馏进 Qwen/Llama 小底座的结果,竞赛级数学、超长推理链与 671B 满血差距明显。别拿 7B 的表现评判”DeepSeek 不行”,那些任务留在 API 上。
坑三:思考段污染输出。 R1 系模型的回答里带思维链(<think> 段),部分前端会原样显示出来。Ollama 新版会在响应里单独给出思考字段【待补:当前版本的实际行为】,接前端时确认它能折叠或剥离思考段,否则日志里全是推理过程。
坑四:拉模型慢与中断。 32B 起步就是十几 GB 的下载量,国内直连容易超时;中断后重新 pull 会续传,但更稳的做法是配置镜像源,步骤见Ollama 安装与国内镜像加速指南。
坑五:默认只监听本机。 想让局域网其他设备访问,要设 OLLAMA_HOST=0.0.0.0 再重启服务;同时务必用防火墙挡住公网访问,裸奔的推理服务谁都能白嫖你的显卡。
最终效果
跑通后的状态:终端或聊天前端随时提问,断网可用、数据不出本机、没有 token 账单;deepseek-r1:7b 在 8 GB 显存卡上的体感速度与 CPU 分担情况【待补:实测数据】。能力预期要对齐:日常问答、中等难度代码、文本处理完全够用;数学竞赛与长链推理这类任务,老实走 API 的满血模型。