DeepSeek R1 蒸馏版显存需求速查:从 1.5B 到 70B

解决什么问题

把 DeepSeek 装进自己电脑,图的是三件事:

  • 隐私:合同、内部代码、病历这类文本不出本机,不经过任何第三方服务器;
  • 稳定:不受网页版高峰”服务器繁忙”和 API 限流的影响,半夜跑批也不用抢额度;
  • 成本:跑批任务零 token 费用,电费之外没有边际成本。

也要先说清两个”不值得”:消费级显卡只能跑蒸馏版,推理能力与满血版有实实在在的差距,重推理任务仍然要用 API;7B 以上的模型对显存有硬要求,硬件不达标体验会很差。所以动手前先看显存表选型号,再决定装不装。

本地与 API 不是二选一,常见分工是:隐私敏感、断网、高频批任务走本地;满血能力、联网时效、移动端随时用走 API 与网页版。接入方式的全景见DeepSeek 获取与使用方式全解

环境与版本

项目要求
操作系统Windows / macOS / Linux 均可
Ollama【待补:当前版本号】;安装与国内下载加速见Ollama 安装与国内镜像加速指南
显卡见下方显存表;无独显也能跑 1.5B(CPU 推理,速度慢)
磁盘量化后的模型权重:7B 级约 4~5 GB,32B 级约 20 GB 上下【待补:装机后实测占用】
聊天前端(可选)ChatBox、Open WebUI,不装也能在终端直接聊

显存要求:先选型号再动手

DeepSeek 开源的满血 V3(通用对话)与 R1(推理)是 671B 参数的 MoE 模型,家用设备不用考虑。官方同时发布了蒸馏版:基于 Qwen 的 1.5B / 7B / 14B / 32B,加上基于 Llama 的 8B / 70B——消费级硬件瞄准的就是这个系列。Ollama 里的对应 tag 与显存经验值如下:

Ollama 模型名参数量显存经验值适配硬件参考
deepseek-r1:1.5b1.5B约 1~2 GB核显、老笔记本、纯 CPU
deepseek-r1:7b7B约 6~8 GB8 GB 显存的显卡
deepseek-r1:8b8B约 6~8 GB8 GB 显存的显卡
deepseek-r1:14b14B约 10~12 GB12 GB 显存显卡
deepseek-r1:32b32B约 20~24 GB24 GB 显存显卡
deepseek-r1:70b70B约 40~48 GB双 24 GB 卡或 48 GB 专业卡
满血 V3 / R1671B数百 GB多卡服务器或云端,家用免谈

经验值的口径:Q4 量级量化权重,加上常用上下文长度的余量。显存占用不止权重一项——KV cache 随上下文长度增长,把 num_ctx 开到几万 tokens 时要另算。动手前用 ollama show 看模型的精确体积,跑起来后用 ollama ps 确认 GPU 分担。各型号在你显卡上的实测速度【待补:实测 tokens/s】。

显存之外:三个决定体验的参数

num_ctx(上下文长度)。Ollama 默认的上下文窗口不大,长文档问答必须调大;但 KV cache 随之膨胀,8 GB 卡上跑 7B 时把 num_ctx 拉满很容易爆显存。经验做法:从 8K 量级起步,按显存余量逐步加。

量化等级。同一参数量有不同量化档位,Q4 档体积最小、速度最快,能力损失可感知但不大;Q8 档更接近原模型,体积约翻倍。Ollama 官方 tag 默认是 Q4 量级,够日常用;对质量敏感再找高量化档(同一模型的多个量化 tag 或社区版本,具体命名以 Ollama 模型页为准)。

温度与采样。官方给 R1 系的建议是温度 0.5~0.7 区间(推荐 0.6 一档),温度过高会让思维链发散;日常问答保持默认即可,跑数学题再按这个区间调。

分步骤:Ollama 跑起来

第 1 步:安装 Ollama 并验证

国内网络下载安装包与模型容易慢或失败,走镜像加速的完整步骤见文末相关阅读。装完先验证:

ollama --version

第 2 步:按显存选型号并拉取

# 8 GB 显存的卡选 7b 或 8b;直接 run 也行,没拉取过会自动先拉
ollama run deepseek-r1:7b

进入对话后随便问一句试手感,/bye 退出。第一次拉模型需要等权重下载完,7B 级约 4~5 GB。

第 3 步:核对 GPU 分担

# PROCESSOR 列显示接近 100% GPU 才是全程显存推理
ollama ps

# 查看模型的精确体积、量化信息
ollama show deepseek-r1:7b

如果 ollama ps 显示 CPU 占比很高,说明显存溢出、部分层被卸载到 CPU,速度会断崖式下降——回到显存表换小一号的模型。

第 4 步:接聊天前端(可选)

ChatBox 里提供方选 Ollama、地址保持默认 http://localhost:11434 即可;Open WebUI 适合自托管成团队入口。程序化调用直接走 Ollama 的 OpenAI 兼容接口:

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-r1:7b",
    "messages": [{"role": "user", "content": "写一个快速排序"}]
  }'

常见坑

坑一:权重装得下,上下文一开就爆。 显存占用是权重加 KV cache 两部分,把 num_ctx 调大后爆显存,Ollama 会静默把部分层卸到 CPU,表现为”能跑但极慢”。降上下文长度或换小模型,别硬扛。

坑二:把蒸馏版当满血 R1 用。 1.5B~70B 是把 R1 的推理能力蒸馏进 Qwen/Llama 小底座的结果,竞赛级数学、超长推理链与 671B 满血差距明显。别拿 7B 的表现评判”DeepSeek 不行”,那些任务留在 API 上。

坑三:思考段污染输出。 R1 系模型的回答里带思维链(<think> 段),部分前端会原样显示出来。Ollama 新版会在响应里单独给出思考字段【待补:当前版本的实际行为】,接前端时确认它能折叠或剥离思考段,否则日志里全是推理过程。

坑四:拉模型慢与中断。 32B 起步就是十几 GB 的下载量,国内直连容易超时;中断后重新 pull 会续传,但更稳的做法是配置镜像源,步骤见Ollama 安装与国内镜像加速指南

坑五:默认只监听本机。 想让局域网其他设备访问,要设 OLLAMA_HOST=0.0.0.0 再重启服务;同时务必用防火墙挡住公网访问,裸奔的推理服务谁都能白嫖你的显卡。

最终效果

跑通后的状态:终端或聊天前端随时提问,断网可用、数据不出本机、没有 token 账单;deepseek-r1:7b 在 8 GB 显存卡上的体感速度与 CPU 分担情况【待补:实测数据】。能力预期要对齐:日常问答、中等难度代码、文本处理完全够用;数学竞赛与长链推理这类任务,老实走 API 的满血模型。

相关阅读