DeepSeek-R1 推理模型与 GRPO 算法解读
本文解读 DeepSeek-R1 系列推理模型及其训练算法 GRPO,分析其如何通过纯强化学习(R1-Zero)及多阶段训练(冷启动、拒绝采样、SFT、RL)激发大模型推理能力,减少对人类标注推理轨迹的依赖,并介绍基于规则的奖励设计与语言一致性优化。
文章分类:大模型与架构
文章子分类:训练优化
文章标题:DeepSeek-R1 推理模型与 GRPO 算法解读
1. 研究背景与核心动机
通用推理(General Reasoning)是人工智能长期面临的重大挑战。近年来,大语言模型(LLM)与思维链(Chain-of-Thought, CoT)提示技术的突破,已在基础推理任务上取得显著进展。然而,这些成功在很大程度上依赖于大量人工标注的推理轨迹,存在两个突出问题:
- 可扩展性差:高质量人类标注成本高、难以规模化;
- 认知偏差与能力上限:人类提供的推理示例可能限制模型探索,使其被约束在类人的思维模式中,难以发现更优、非类人的推理路径。
DeepSeek-R1 的核心动机是探索以纯强化学习(RL)激发大模型推理能力的可行性,尽量减少对人类标注推理轨迹的依赖。其研究假设是:人类预先定义的推理模式可能限制模型探索,而无约束的 RL 训练能够更好地激励新型推理能力的涌现。为验证这一假设,研究团队首先提出了完全跳过监督微调的 DeepSeek-R1-Zero。
2. DeepSeek-R1-Zero:纯强化学习训练范式
Figure 2:AIME accuracy of DeepSeek-R1-Zero during training. For each question, we sample 16 responses and calculate the overall average accuracy to ensure a stable evaluation.
Figure 1:Benchmark performance of DeepSeek-R1.
图 2
DeepSeek-R1-Zero 基于 DeepSeek-V3-Base,直接进行强化学习,跳过传统的监督微调(SFT)阶段。训练过程中,仅通过最终答案的正确性提供奖励信号,对推理过程本身不做显式约束。
2.1 训练设置
- 基础模型:DeepSeek-V3-Base
- RL 算法:Group Relative Policy Optimization(GRPO)
- 奖励来源:答案正确性(Accuracy)+ 输出格式(Format)
- 关键超参数:
- 学习率:$3\times10^{-6}$
- KL 系数:0.001
- 采样温度(temperature):1.0
- 每个问题采样输出数:16
- 最大输出长度:前 8,200 步为 32,768 tokens,之后为 65,536 tokens
- 总训练步数:10,400 步(约 1.6 个 epoch)
- 每 400 步用最新策略替换参考模型(reference model)
2.2 涌现的推理行为
尽管没有显式教授推理,DeepSeek-R1-Zero 在 RL 过程中自发涌现出多种复杂推理行为:
- 自我反思(self-reflection)
- 验证(verification)
- 多路径探索
- 动态策略调整
在 AIME 2024 上,其平均 pass@1 从初始的 15.6% 提升至 77.9%;结合 self-consistency 解码(cons@16)后,准确率进一步提升至 86.7%,显著超越人类参赛者的平均水平。同时,模型的平均响应长度随训练持续增长,表明它学会了为更难的问题分配更多“思考时间”。
训练中还出现了典型的“aha moment”:模型会在推理中突然使用 “wait” 等词汇,进行自我纠正。
3. GRPO 算法与奖励设计
图 3
R1-Zero 的成功验证了纯 RL 训练在推理任务上的潜力,而实现这一范式的算法核心是 GRPO。DeepSeek-R1-Zero 与 DeepSeek-R1 均采用 Group Relative Policy Optimization(GRPO),其设计初衷是简化 Proximal Policy Optimization(PPO)的训练流程、降低资源消耗。GRPO 的最大特点是不需要额外的 Critic/Value 模型,而是通过组内采样结果的相对奖励来估计优势(advantage)。
3.1 GRPO 目标函数
对于每个问题 $q$,从旧策略 $\pi_{\theta_{\text{old}}}$ 中采样一组输出 ${o_1, o_2, \dots, o_G}$,优化目标为:
$$ J_{\text{GRPO}}(\theta) = \mathbb{E}{q \sim P(Q),{o_i}{i=1}^G \sim \pi_{\theta_{\text{old}}}(\cdot|q)} \left[ \frac{1}{G} \sum_{i=1}^{G} \left( \min\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)} A_i,\ \text{clip}\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)}, 1-\varepsilon, 1+\varepsilon \right) A_i \right) - \beta D_{\text{KL}}(\pi_\theta | \pi_{\text{ref}}) \right) \right] $$
其中 KL 散度的无偏估计为:
$$ D_{\text{KL}}(\pi_\theta | \pi_{\text{ref}}) = \frac{\pi_{\text{ref}}(o_i|q)}{\pi_\theta(o_i|q)} - \log \frac{\pi_{\text{ref}}(o_i|q)}{\pi_\theta(o_i|q)} - 1 $$
优势 $A_i$ 通过组内奖励的相对位置计算:
$$ A_i = \frac{r_i - \text{mean}({r_1, r_2, \dots, r_G})}{\text{std}({r_1, r_2, \dots, r_G})} $$
3.2 基于规则的奖励函数
DeepSeek-R1-Zero 采用基于规则的奖励,避免使用神经奖励模型,以规避 reward hacking 和大规模训练中的不稳定性。奖励由两部分组成:
$$ Reward_{\text{rule}} = Reward_{\text{acc}} + Reward_{\text{format}} $$
- Accuracy Reward:判断最终答案是否正确。数学题通过规则匹配最终答案,代码题通过编译器和预定义测试用例验证。
- Format Reward:强制模型将推理过程放在
<think>标签内,最终答案放在<answer>标签内,增强可读性。
3.3 DeepSeek-R1 中的扩展奖励
在 DeepSeek-R1 的多阶段训练中,奖励信号进一步扩展。第一阶段 RL 引入语言一致性奖励,以减少中英文混合问题:
$$ Reward_{\text{language}} = \frac{\text{Num}(Words_{\text{target}})}{\text{Num}(Words)} $$
第二阶段 RL 综合了推理奖励与通用奖励:
$$ Reward = Reward_{\text{reasoning}} + Reward_{\text{general}} + Reward_{\text{language}} $$
其中推理奖励即基于规则的奖励,通用奖励由奖励模型(有用性/安全性)分数与格式奖励组成。
4. DeepSeek-R1:多阶段训练框架
Figure 3:The average response length of DeepSeek-R1-Zero on the training set during the RL process. DeepSeek-R1-Zero naturally learns to solve reasoning tasks with more thinking time.
Figure 1:Benchmark performance of DeepSeek-R1.
图 4
图 4
DeepSeek-R1-Zero 虽展现了强大的推理能力,但存在可读性差、语言混合、通用任务能力弱等问题。为此,DeepSeek-R1 采用融合 冷启动(Cold Start)、拒绝采样(Rejection Sampling)、监督微调(SFT)与强化学习的多阶段训练框架。
4.1 训练流程
- 冷启动 SFT:收集数千条具备对话式、人类可读的长 CoT 数据,对 DeepSeek-V3-Base 进行微调,改善输出风格与语言一致性。
- 第一阶段 RL:在推理数据上继续使用基于规则的奖励,同时加入语言一致性奖励,提升可读性。
- 拒绝采样 + 第二阶段 SFT:
- 从第一阶段模型中通过拒绝采样生成约 600k 推理样本;
- 加入约 200k 非推理样本(写作、事实问答、翻译等);
- 总计约 800k 监督样本。
- 第二阶段 RL:在混合数据上结合 rule-based reward、helpfulness reward model 和 safety reward model,进一步提升 helpfulness 与 harmlessness。
4.2 关键改进
- 可读性:通过冷启动数据,使推理过程更像自然的人类对话;
- 语言一致性:通过语言一致性奖励抑制中英文混用;
- 通用能力:引入非推理数据,提升写作、开放域问答等通用任务表现。
表 1:DeepSeek-R1 各阶段实验结果
| Benchmark (Metric) | R1-Zero | R1-Dev1 | R1-Dev2 | R1-Dev3 | R1 |
|---|---|---|---|---|---|
| English | |||||
| MMLU (EM) | 88.8 | 89.1 | 91.2 | 91.0 | 90.8 |
| MMLU-Redux (EM) | 85.6 | 90.0 | 93.0 | 93.1 | 92.9 |
| MMLU-Pro (EM) | 68.9 | 74.1 | 83.8 | 83.1 | 84.0 |
| DROP (3-shot F1) | 89.1 | 89.8 | 91.1 | 88.7 | 92.2 |
| IF-Eval (Prompt Strict) | 46.6 | 71.7 | 72.0 | 78.1 | 83.3 |
| GPQA Diamond (Pass@1) | 75.8 | 66.1 | 70.7 | 71.2 | 71.5 |
| SimpleQA (Correct) | 30.3 | 17.8 | 28.2 | 24.9 | 30.1 |
| FRAMES (Acc.) | 82.3 | 78.5 | 81.8 | 81.9 | 82.5 |
| AlpacaEval2.0 (LC-winrate) | 24.7 | 50.1 | 55.8 | 62.1 | 87.6 |
| ArenaHard (GPT-4-1106) | 53.6 | 77.0 | 73.2 | 75.6 | 92.3 |
| Code | |||||
| LiveCodeBench (Pass@1-COT) | 50.0 | 57.5 | 63.5 | 64.6 | 65.9 |
| Codeforces (Percentile) | 80.4 | 84.5 | 90.5 | 92.1 | 96.3 |
| Codeforces (Rating) | 1444 | 1534 | 1687 | 1746 | 2029 |
| SWE Verified (Resolved) | 43.2 | 39.6 | 44.6 | 45.6 | 49.2 |
| Aider-Polyglot (Acc.) | 12.2 | 6.7 | 25.6 | 44.8 | 53.3 |
| Math | |||||
| AIME 2024 (Pass@1) | 77.9 | 59.0 | 74.0 | 78.1 | 79.8 |
| MATH-500 (Pass@1) | 95.9 | 94.2 | 95.9 | 95.4 | 97.3 |
| CNMO 2024 (Pass@1) | 88.1 | 58.0 | 73.9 | 77.3 | 78.8 |
| Chinese | |||||
| CLUEWSC (EM) | 93.1 | 92.8 | 92.6 | 91.6 | 92.8 |
| C-Eval (EM) | 92.8 | 85.7 | 91.9 | 86.4 | 91.8 |
| C-SimpleQA (Correct) | 66.4 | 58.8 | 64.2 | 66.9 | 63.7 |
注:原文以加粗标注统计显著性(t-test,p < 0.01),本表未保留格式。
5. 实验评估、蒸馏与生态影响
图 5
5.1 主模型性能
DeepSeek-R1 在数学、代码、STEM 等可验证任务上表现突出,与 OpenAI o1-1217 相当。下表对比了 DeepSeek-R1 与多个前沿模型:
表 2:DeepSeek-R1 与其他代表性模型对比
| Benchmark (Metric) | Claude-3.5-Sonnet-1022 | GPT-4o-0513 | DeepSeek V3 | OpenAI o1-mini | OpenAI o1-1217 | DeepSeek R1 |
|---|---|---|---|---|---|---|
| Architecture | - | - | MoE | - | - | MoE |
| # Activated Params | - | - | 37B | - | - | 37B |
| # Total Params | - | - | 671B | - | - | 671B |
| English | ||||||
| MMLU (EM) | 88.3 | 87.2 | 88.5 | 85.2 | 91.8 | 90.8 |
| MMLU-Redux (EM) | 88.9 | 88.0 | 89.1 | 86.7 | - | 92.9 |
| MMLU-Pro (EM) | 78.0 | 72.6 | 75.9 | 80.3 | - | 84.0 |
| DROP (3-shot F1) | 88.3 | 83.7 | 91.6 | 83.9 | 90.2 | 92.2 |
| IF-Eval (Prompt Strict) | 86.5 | 84.3 | 86.1 | 84.8 | - | 83.3 |
| GPQA Diamond (Pass@1) | 65.0 | 49.9 | 59.1 | 60.0 | 75.7 | 71.5 |
| SimpleQA (Correct) | 28.4 | 38.2 | 24.9 | 7.0 | 47.0 | 30.1 |
| FRAMES (Acc.) | 72.5 | 80.5 | 73.3 | 76.9 | - | 82.5 |
| AlpacaEval2.0 (LC-winrate) | 52.0 | 51.1 | 70.0 | 57.8 | - | 87.6 |
| ArenaHard (GPT-4-1106) | 85.2 | 80.4 | 85.5 | 92.0 | - | 92.3 |
| Code | ||||||
| LiveCodeBench (Pass@1-COT) | 38.9 | 32.9 | 36.2 | 53.8 | 63.4 | 65.9 |
| Codeforces (Percentile) | 20.3 | 23.6 | 58.7 | 93.4 | 96.6 | 96.3 |
| Codeforces (Rating) | 717 | 759 | 1134 | 1820 | 2061 | 2029 |
| SWE Verified (Resolved) | 50.8 | 38.8 | 42.0 | 41.6 | 48.9 | 49.2 |
| Aider-Polyglot (Acc.) | 45.3 | 16.0 | 49.6 | 32.9 | 61.7 | 53.3 |
| Math | ||||||
| AIME 2024 (Pass@1) | 16.0 | 9.3 | 39.2 | 63.6 | 79.2 | 79.8 |
| MATH-500 (Pass@1) | 78.3 | 74.6 | 90.2 | 90.0 | 96.4 | 97.3 |
| CNMO 2024 (Pass@1) | 13.1 | 10.8 | 43.2 | 67.6 | - | 78.8 |
| Chinese | ||||||
| CLUEWSC (EM) | 85.4 | 87.9 | 90.9 | 89.9 | - | 92.8 |
| C-Eval (EM) | 76.7 | 76.0 | 86.5 | 68.9 | - | 91.8 |
| C-SimpleQA (Correct) | 55.4 | 58.7 | 68.0 | 40.3 | - | 63.7 |
在最新竞赛(AIME 2025、AMC 12 2024)上的结果进一步验证了其泛化能力:
表 3:最新数学竞赛表现
| Average Score | AMC 12 2024 | AIME 2025 | USAMO Index | |
|---|---|---|---|---|
| Human Participants | 61.7 | 6.2/15 | 123.7 | - |
| GPT-4o-0513 | 84.0 | 2.0/15 | 104.0 | - |
| DeepSeek V3 | 98.3 | 3.3/15 | 131.3 | - |
| OpenAI o1-1217 | 141.0 | 12.0/15 | 261.0 | - |
| DeepSeek R1 | 143.7 | 11.3/15 | 256.7 | - |
5.2 模型蒸馏
为了以更低成本普及强推理能力,DeepSeek-R1 将推理能力蒸馏到更小的开源模型中。蒸馏使用约 800k 条由 DeepSeek-R1 生成的数据,仅进行 SFT,不加入 RL 阶段。
表 4:蒸馏模型及其基座与初始学习率
| Distilled Model | Base Model | Initial Learning Rate |
|---|---|---|
| DeepSeek-R1-Distill-Qwen-1.5B | Qwen2.5-Math-1.5B | $1\times10^{-4}$ |
| DeepSeek-R1-Distill-Qwen-7B | Qwen2.5-Math-7B | $8\times10^{-5}$ |
| DeepSeek-R1-Distill-Qwen-14B | Qwen2.5-14B | $7\times10^{-5}$ |
| DeepSeek-R1-Distill-Qwen-32B | Qwen2.5-32B | $6\times10^{-5}$ |
| DeepSeek-R1-Distill-Llama-8B | Llama-3.1-8B | $5\times10^{-5}$ |
| DeepSeek-R1-Distill-Llama-70B | Llama-3.3-70B-Instruct | $2\times10^{-5}$ |
表 5:蒸馏模型在推理基准上的表现
| Model | AIME 2024 pass@1 | cons@64 | MATH-500 pass@1 | GPQA Diamond pass@1 | LiveCodeBench pass@1 | Codeforces rating |
|---|---|---|---|---|---|---|
| GPT-4o-0513 | 9.3 | 13.4 | 74.6 | 49.9 | 32.9 | 759 |
| Claude-3.5-Sonnet-1022 | 16.0 | 26.7 | 78.3 | 65.0 | 38.9 | 717 |
| DeepSeek-R1-Distill-Qwen-1.5B | 28.9 | 52.7 | 83.9 | 33.8 | 16.9 | 954 |
| DeepSeek-R1-Distill-Qwen-7B | 55.5 | 83.3 | 92.8 | 49.1 | 37.6 | 1189 |
| DeepSeek-R1-Distill-Qwen-14B | 69.7 | 80.0 | 93.9 | 59.1 | 53.1 | 1481 |
| DeepSeek-R1-Distill-Qwen-32B | 72.6 | 83.3 | 94.3 | 62.1 | 57.2 | 1691 |
| DeepSeek-R1-Distill-Llama-8B | 50.4 | 80.0 | 89.1 | 49.0 | 39.6 | 1205 |
| DeepSeek-R1-Distill-Llama-70B | 70.0 | 86.7 | 94.5 | 65.2 | 57.5 | 1633 |
实验表明,蒸馏后的小模型在推理任务上显著超越原始指令微调版本。例如,仅 1.5B 参数的蒸馏模型在数学基准上已超过 GPT-4o 和 Claude-3.5-Sonnet。
5.3 训练成本与开源
表 6:DeepSeek-R1 训练成本(以 H800 每小时 2 美元估算)
| Training Costs | DeepSeek-R1-Zero | SFT data creation | DeepSeek-R1 | Total |
|---|---|---|---|---|
| H800 GPU Hours | 101K | 5K | 41K | 147K |
| USD | $202K | $10K | $82K | $294K |
DeepSeek-R1、DeepSeek-R1-Zero 以及蒸馏模型均已开源,推动长链式推理(Long CoT)研究的进一步发展。
6. 局限、安全与未来方向
6.1 主要局限
- 结构化输出与工具使用:DeepSeek-R1 在结构化输出和利用外部工具(如搜索引擎、计算器)方面仍有提升空间。
- Token 效率:模型会根据问题难度动态分配计算量,但简单问题上仍存在“过度思考”现象。
- 语言混合:当前模型主要针对中文和英文优化,处理其他语言时可能出现语言混用。
- Prompt 敏感性:Few-shot 提示通常会降低其性能,建议使用 zero-shot 设置。
- 软件工程任务:由于长评估时间影响 RL 效率,DeepSeek-R1 在软件工程基准上提升有限。
- Reward Hacking:纯 RL 依赖可靠的奖励信号;对于难以定义规则奖励的任务(如写作),模型可能利用奖励漏洞。
6.2 安全
DeepSeek-R1 配备了基于 DeepSeek-V3 的风险控制系统,通过关键词过滤和模型级风险审查提升安全性。评估显示,结合风险控制系统后,模型在多语言安全和抗 jailbreak 攻击方面达到较高水平。
6.3 未来方向
- 构建更鲁棒的奖励模型,扩展纯 RL 可处理的任务范围;
- 引入工具增强推理(如编译器、搜索引擎、实验验证);
- 提升 token 效率,减少过度推理;
- 扩展多语言支持与软件工程任务上的 RL 训练。
原文来源
DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948v2 [cs.CL], 2025.
原文链接
相关文章
Transformer 架构详解:从 Attention 机制到行业范式
本文全面解析Transformer:首个完全基于注意力机制的序列转换模型。文章先对比RNN/CNN的不足,再介绍编码器-解码器架构、多头自注意力、Scaled Dot-Product Attention、位置编码与训练细节,最后给出WMT机器翻译实验结果,说明其训练效率与翻译质量优势。
阅读更多