主题模式
Are you an LLM? You can read better optimized documentation at /ai/llm/deepseek-r1.md for this page in Markdown format
2026 DeepSeek R1 部署教程:打造你的专属代码助手
2026 年,DeepSeek R1 的发布震惊了整个 AI 圈。这款开源推理模型在代码生成、数学推理、逻辑分析等任务上表现出色,甚至可以媲美某些付费 API 服务。
更重要的是,通过 Ollama 的支持,你可以在自己的 VPS 或家用服务器上本地运行 DeepSeek R1,实现真正的 AI 编程自由。
🧐 为什么选择 DeepSeek R1?
相比 GPT-4、Claude 等付费 API,本地部署 DeepSeek R1 有以下优势:
- 零成本调用:一次部署,无限使用,不再为 API 费用焦虑。
- 隐私安全:代码不离开本地,企业项目、敏感数据放心使用。
- 离线可用:无需联网,断网环境下也能正常工作。
- 深度推理:R1 专注于推理任务,代码生成质量极高。
🛠️ 环境准备
硬件配置建议
DeepSeek R1 提供多个量化版本,根据你的硬件选择合适的模型:
| 模型版本 | 参数量 | 最低内存 | 推荐配置 | 适用场景 |
|---|---|---|---|---|
| deepseek-r1:1.5b | 1.5B | 4GB | 8GB 内存 | 快速补全、轻量任务 |
| deepseek-r1:7b | 7B | 8GB | 16GB 内存 | 日常编程辅助 |
| deepseek-r1:8b | 8B | 8GB | 16GB 内存 | 平衡性能与资源 |
| deepseek-r1:14b | 14B | 16GB | 32GB 内存 | 复杂推理、深度分析 |
| deepseek-r1:32b | 32B | 32GB | 64GB 内存 | 高级推理任务 |
配置建议
对于 N100 小主机或普通 VPS,推荐使用 7B 或 8B 版本,性价比最高。如果你有 GPU(如 RTX 3060 以上),可以尝试 14B 版本获得更好的推理效果。
安装 Ollama
如果还没有安装 Ollama,请参考 Ollama 入门教程 完成基础环境配置。
快速安装命令:
bash
curl -fsSL https://ollama.com/install.sh | sh📦 部署 DeepSeek R1
1. 下载并运行模型
使用 Ollama 一键下载并运行 DeepSeek R1:
bash
# 推荐:8B 版本(平衡性能与资源)
ollama run deepseek-r1:8b
# 或者选择其他版本
ollama run deepseek-r1:1.5b # 轻量版
ollama run deepseek-r1:7b # 标准版
ollama run deepseek-r1:14b # 高性能版首次运行会自动下载模型权重文件。8B 版本约 4.9GB,下载时间取决于网络速度。
2. 验证模型运行
进入交互界面后,输入一个测试问题:
>>> 用 Python 实现一个快速排序算法,并解释原理模型会生成完整的代码实现和详细解释。DeepSeek R1 的推理过程会显示 <think> 标签,让你看到它的思考路径。
3. 退出交互界面
测试完成后,输入 /bye 退出:
>>> /bye🔗 与 Cursor 集成
Cursor 是目前最流行的 AI 编程 IDE。将 DeepSeek R1 作为本地模型接入 Cursor,可以实现:
- 无限免费调用:不再受 Cursor Pro 订阅限制。
- 更快的响应:本地推理,无需等待 API 响应。
- 更低的延迟:代码补全实时反馈。
步骤 1:开启 Ollama 远程访问
如果 Cursor 和 Ollama 不在同一台机器上,需要开启远程访问:
bash
# 编辑服务文件
sudo nano /etc/systemd/system/ollama.service
# 在 [Service] 下添加
Environment="OLLAMA_HOST=0.0.0.0:11434"
# 重载并重启
sudo systemctl daemon-reload
sudo systemctl restart ollama安全提醒
开启 0.0.0.0 后,任何人都能访问你的 Ollama 服务。建议配合防火墙限制 IP,或使用 Cloudflare Tunnel 进行安全代理。
步骤 2:在 Cursor 中配置本地模型
- 打开 Cursor 设置(
Ctrl + Shift + J或Cmd + Shift + J) - 进入 Models → Add Model
- 输入模型名称:
deepseek-r1:8b - 设置 OpenAI API Key:
ollama(随意填写,Ollama 不需要验证) - 设置 Base URL:
http://your-server-ip:11434/v1

步骤 3:开始使用
配置完成后,在 Cursor 的 Chat 模式中选择 deepseek-r1:8b 模型,即可开始使用本地 DeepSeek R1 进行编程辅助。
🔗 与 VS Code 集成
如果你更喜欢使用 VS Code,可以通过 Continue 插件接入 DeepSeek R1。
安装 Continue 插件
- 在 VS Code 扩展市场搜索
Continue - 安由 Continue 插件
- 打开 Continue 侧边栏(
Ctrl + L)
配置本地模型
在 Continue 配置文件(~/.continue/config.json)中添加:
json
{
"models": [
{
"title": "DeepSeek R1 Local",
"provider": "ollama",
"model": "deepseek-r1:8b",
"apiBase": "http://localhost:11434"
}
]
}保存后,在 Continue 界面选择 DeepSeek R1 Local 模型即可使用。
💡 使用技巧
1. 选择合适的模型版本
根据任务复杂度选择模型:
- 简单补全:使用
1.5b版本,响应最快。 - 代码生成:使用
7b或8b版本,质量最佳。 - 复杂推理:使用
14b或32b版本,深度分析能力强。
2. 利用推理过程
DeepSeek R1 会展示 <think> 推理过程。你可以:
- 观察模型的思考路径,理解它的决策逻辑。
- 通过推理过程判断答案的正确性。
- 用于教学场景,展示 AI 的推理能力。
3. 自定义模型参数
创建自定义 Modelfile 微调输出风格:
dockerfile
FROM deepseek-r1:8b
PARAMETER temperature 0.3
SYSTEM """
你是一位资深软件工程师,专注于编写高质量、可维护的代码。
回答时请:
1. 先分析问题需求
2. 提供完整的代码实现
3. 解释关键设计决策
"""构建并运行:
bash
ollama create my-coder -f Modelfile
ollama run my-coder🔥 性能优化建议
使用 GPU 加速
如果你的服务器有 NVIDIA GPU,可以启用 GPU 加速:
bash
# 安装 NVIDIA Container Toolkit
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
# 配置 Ollama 使用 GPU
ollama run deepseek-r1:8b --gpuGPU 加速可以将推理速度提升 3-5 倍。
量化模型选择
Ollama 默认使用 4-bit 量化。如果你需要更高精度:
bash
# 查看可用量化版本
ollama list
# 使用 FP16 版本(需要更多内存)
ollama run deepseek-r1:8b-q8_0📊 与其他模型对比
| 模型 | 推理能力 | 代码生成 | 内存占用 | 推荐指数 |
|---|---|---|---|---|
| DeepSeek R1 7B | ★★★★☆ | ★★★★★ | 8GB | ⭐⭐⭐⭐⭐ |
| Llama 4 8B | ★★★☆☆ | ★★★★☆ | 8GB | ⭐⭐⭐⭐ |
| Qwen 2.5 7B | ★★★☆☆ | ★★★☆☆ | 8GB | ⭐⭐⭐ |
| Mistral 7B | ★★☆☆☆ | ★★★☆☆ | 8GB | ⭐⭐⭐ |
DeepSeek R1 在推理和代码任务上表现突出,是本地 AI 编程的首选。
🚀 下一步
❓ 常见问题
DeepSeek R1 和 DeepSeek V3 有什么区别?
DeepSeek R1 是专注于推理任务的模型,擅长代码生成、数学推理、逻辑分析。DeepSeek V3 是通用对话模型,适合日常问答、创意写作。如果你主要用于编程辅助,推荐使用 R1。
本地模型和 API 服务有什么差距?
本地部署的 DeepSeek R1 8B 在代码任务上已经接近 GPT-4 Turbo 的水平。对于复杂的推理任务,32B 版本表现更加出色。但如果你需要最顶级的推理能力,可以考虑 银河录像局 提供的 ChatGPT Plus 合租服务。
如何判断模型是否正在正确运行?
输入问题后,观察推理过程:
<think>
用户要求实现快速排序...
首先分析算法原理...
设计递归实现方案...
</think>如果能看到 <think> 标签中的推理过程,说明模型正在正确运行。
内存不足怎么办?
如果遇到内存不足错误:
- 將换用更小的模型版本(如 1.5b)
- 关闭其他占用内存的服务
- 添加
--num-gpu 0参数禁用 GPU(有时 GPU 会额外占用内存)
bash
ollama run deepseek-r1:1.5b