DeepSeek-R1 推理模型与 GRPO 算法解读

本文解读 DeepSeek-R1 系列推理模型及其训练算法 GRPO,分析其如何通过纯强化学习(R1-Zero)及多阶段训练(冷启动、拒绝采样、SFT、RL)激发大模型推理能力,减少对人类标注推理轨迹的依赖,并介绍基于规则的奖励设计与语言一致性优化。

A
AGISeed Team
AGISeed 作者

文章分类:大模型与架构
文章子分类:训练优化
文章标题:DeepSeek-R1 推理模型与 GRPO 算法解读


1. 研究背景与核心动机

通用推理(General Reasoning)是人工智能长期面临的重大挑战。近年来,大语言模型(LLM)与思维链(Chain-of-Thought, CoT)提示技术的突破,已在基础推理任务上取得显著进展。然而,这些成功在很大程度上依赖于大量人工标注的推理轨迹,存在两个突出问题:

  • 可扩展性差:高质量人类标注成本高、难以规模化;
  • 认知偏差与能力上限:人类提供的推理示例可能限制模型探索,使其被约束在类人的思维模式中,难以发现更优、非类人的推理路径。

DeepSeek-R1 的核心动机是探索以纯强化学习(RL)激发大模型推理能力的可行性,尽量减少对人类标注推理轨迹的依赖。其研究假设是:人类预先定义的推理模式可能限制模型探索,而无约束的 RL 训练能够更好地激励新型推理能力的涌现。为验证这一假设,研究团队首先提出了完全跳过监督微调的 DeepSeek-R1-Zero。


2. DeepSeek-R1-Zero:纯强化学习训练范式

Figure 2:AIME accuracy of DeepSeek-R1-Zero during training. Figure 2:AIME accuracy of DeepSeek-R1-Zero during training. For each question, we sample 16 responses and calculate the overall average accuracy to ensure a stable evaluation.

Figure 1:Benchmark performance of DeepSeek-R1.

图 2

DeepSeek-R1-Zero 基于 DeepSeek-V3-Base,直接进行强化学习,跳过传统的监督微调(SFT)阶段。训练过程中,仅通过最终答案的正确性提供奖励信号,对推理过程本身不做显式约束。

2.1 训练设置

  • 基础模型:DeepSeek-V3-Base
  • RL 算法:Group Relative Policy Optimization(GRPO)
  • 奖励来源:答案正确性(Accuracy)+ 输出格式(Format)
  • 关键超参数
    • 学习率:$3\times10^{-6}$
    • KL 系数:0.001
    • 采样温度(temperature):1.0
    • 每个问题采样输出数:16
    • 最大输出长度:前 8,200 步为 32,768 tokens,之后为 65,536 tokens
    • 总训练步数:10,400 步(约 1.6 个 epoch)
    • 每 400 步用最新策略替换参考模型(reference model)

2.2 涌现的推理行为

尽管没有显式教授推理,DeepSeek-R1-Zero 在 RL 过程中自发涌现出多种复杂推理行为:

  • 自我反思(self-reflection)
  • 验证(verification)
  • 多路径探索
  • 动态策略调整

在 AIME 2024 上,其平均 pass@1 从初始的 15.6% 提升至 77.9%;结合 self-consistency 解码(cons@16)后,准确率进一步提升至 86.7%,显著超越人类参赛者的平均水平。同时,模型的平均响应长度随训练持续增长,表明它学会了为更难的问题分配更多“思考时间”。

训练中还出现了典型的“aha moment”:模型会在推理中突然使用 “wait” 等词汇,进行自我纠正。


3. GRPO 算法与奖励设计

图 3

R1-Zero 的成功验证了纯 RL 训练在推理任务上的潜力,而实现这一范式的算法核心是 GRPO。DeepSeek-R1-Zero 与 DeepSeek-R1 均采用 Group Relative Policy Optimization(GRPO),其设计初衷是简化 Proximal Policy Optimization(PPO)的训练流程、降低资源消耗。GRPO 的最大特点是不需要额外的 Critic/Value 模型,而是通过组内采样结果的相对奖励来估计优势(advantage)。

3.1 GRPO 目标函数

对于每个问题 $q$,从旧策略 $\pi_{\theta_{\text{old}}}$ 中采样一组输出 ${o_1, o_2, \dots, o_G}$,优化目标为:

$$ J_{\text{GRPO}}(\theta) = \mathbb{E}{q \sim P(Q),{o_i}{i=1}^G \sim \pi_{\theta_{\text{old}}}(\cdot|q)} \left[ \frac{1}{G} \sum_{i=1}^{G} \left( \min\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)} A_i,\ \text{clip}\left( \frac{\pi_\theta(o_i|q)}{\pi_{\theta_{\text{old}}}(o_i|q)}, 1-\varepsilon, 1+\varepsilon \right) A_i \right) - \beta D_{\text{KL}}(\pi_\theta | \pi_{\text{ref}}) \right) \right] $$

其中 KL 散度的无偏估计为:

$$ D_{\text{KL}}(\pi_\theta | \pi_{\text{ref}}) = \frac{\pi_{\text{ref}}(o_i|q)}{\pi_\theta(o_i|q)} - \log \frac{\pi_{\text{ref}}(o_i|q)}{\pi_\theta(o_i|q)} - 1 $$

优势 $A_i$ 通过组内奖励的相对位置计算:

$$ A_i = \frac{r_i - \text{mean}({r_1, r_2, \dots, r_G})}{\text{std}({r_1, r_2, \dots, r_G})} $$

3.2 基于规则的奖励函数

DeepSeek-R1-Zero 采用基于规则的奖励,避免使用神经奖励模型,以规避 reward hacking 和大规模训练中的不稳定性。奖励由两部分组成:

$$ Reward_{\text{rule}} = Reward_{\text{acc}} + Reward_{\text{format}} $$

  • Accuracy Reward:判断最终答案是否正确。数学题通过规则匹配最终答案,代码题通过编译器和预定义测试用例验证。
  • Format Reward:强制模型将推理过程放在 <think> 标签内,最终答案放在 <answer> 标签内,增强可读性。

3.3 DeepSeek-R1 中的扩展奖励

在 DeepSeek-R1 的多阶段训练中,奖励信号进一步扩展。第一阶段 RL 引入语言一致性奖励,以减少中英文混合问题:

$$ Reward_{\text{language}} = \frac{\text{Num}(Words_{\text{target}})}{\text{Num}(Words)} $$

第二阶段 RL 综合了推理奖励与通用奖励:

$$ Reward = Reward_{\text{reasoning}} + Reward_{\text{general}} + Reward_{\text{language}} $$

其中推理奖励即基于规则的奖励,通用奖励由奖励模型(有用性/安全性)分数与格式奖励组成。


4. DeepSeek-R1:多阶段训练框架

Figure 3:The average response length of DeepSeek-R1-Zero on Figure 3:The average response length of DeepSeek-R1-Zero on the training set during the RL process. DeepSeek-R1-Zero naturally learns to solve reasoning tasks with more thinking time.

Figure 1:Benchmark performance of DeepSeek-R1. Figure 1:Benchmark performance of DeepSeek-R1.

图 4

图 4

DeepSeek-R1-Zero 虽展现了强大的推理能力,但存在可读性差、语言混合、通用任务能力弱等问题。为此,DeepSeek-R1 采用融合 冷启动(Cold Start)、拒绝采样(Rejection Sampling)、监督微调(SFT)与强化学习的多阶段训练框架。

4.1 训练流程

  1. 冷启动 SFT:收集数千条具备对话式、人类可读的长 CoT 数据,对 DeepSeek-V3-Base 进行微调,改善输出风格与语言一致性。
  2. 第一阶段 RL:在推理数据上继续使用基于规则的奖励,同时加入语言一致性奖励,提升可读性。
  3. 拒绝采样 + 第二阶段 SFT
    • 从第一阶段模型中通过拒绝采样生成约 600k 推理样本;
    • 加入约 200k 非推理样本(写作、事实问答、翻译等);
    • 总计约 800k 监督样本。
  4. 第二阶段 RL:在混合数据上结合 rule-based reward、helpfulness reward model 和 safety reward model,进一步提升 helpfulness 与 harmlessness。

4.2 关键改进

  • 可读性:通过冷启动数据,使推理过程更像自然的人类对话;
  • 语言一致性:通过语言一致性奖励抑制中英文混用;
  • 通用能力:引入非推理数据,提升写作、开放域问答等通用任务表现。

表 1:DeepSeek-R1 各阶段实验结果

Benchmark (Metric)R1-ZeroR1-Dev1R1-Dev2R1-Dev3R1
English
MMLU (EM)88.889.191.291.090.8
MMLU-Redux (EM)85.690.093.093.192.9
MMLU-Pro (EM)68.974.183.883.184.0
DROP (3-shot F1)89.189.891.188.792.2
IF-Eval (Prompt Strict)46.671.772.078.183.3
GPQA Diamond (Pass@1)75.866.170.771.271.5
SimpleQA (Correct)30.317.828.224.930.1
FRAMES (Acc.)82.378.581.881.982.5
AlpacaEval2.0 (LC-winrate)24.750.155.862.187.6
ArenaHard (GPT-4-1106)53.677.073.275.692.3
Code
LiveCodeBench (Pass@1-COT)50.057.563.564.665.9
Codeforces (Percentile)80.484.590.592.196.3
Codeforces (Rating)14441534168717462029
SWE Verified (Resolved)43.239.644.645.649.2
Aider-Polyglot (Acc.)12.26.725.644.853.3
Math
AIME 2024 (Pass@1)77.959.074.078.179.8
MATH-500 (Pass@1)95.994.295.995.497.3
CNMO 2024 (Pass@1)88.158.073.977.378.8
Chinese
CLUEWSC (EM)93.192.892.691.692.8
C-Eval (EM)92.885.791.986.491.8
C-SimpleQA (Correct)66.458.864.266.963.7

注:原文以加粗标注统计显著性(t-test,p < 0.01),本表未保留格式。


5. 实验评估、蒸馏与生态影响

图 5

5.1 主模型性能

DeepSeek-R1 在数学、代码、STEM 等可验证任务上表现突出,与 OpenAI o1-1217 相当。下表对比了 DeepSeek-R1 与多个前沿模型:

表 2:DeepSeek-R1 与其他代表性模型对比

Benchmark (Metric)Claude-3.5-Sonnet-1022GPT-4o-0513DeepSeek V3OpenAI o1-miniOpenAI o1-1217DeepSeek R1
Architecture--MoE--MoE
# Activated Params--37B--37B
# Total Params--671B--671B
English
MMLU (EM)88.387.288.585.291.890.8
MMLU-Redux (EM)88.988.089.186.7-92.9
MMLU-Pro (EM)78.072.675.980.3-84.0
DROP (3-shot F1)88.383.791.683.990.292.2
IF-Eval (Prompt Strict)86.584.386.184.8-83.3
GPQA Diamond (Pass@1)65.049.959.160.075.771.5
SimpleQA (Correct)28.438.224.97.047.030.1
FRAMES (Acc.)72.580.573.376.9-82.5
AlpacaEval2.0 (LC-winrate)52.051.170.057.8-87.6
ArenaHard (GPT-4-1106)85.280.485.592.0-92.3
Code
LiveCodeBench (Pass@1-COT)38.932.936.253.863.465.9
Codeforces (Percentile)20.323.658.793.496.696.3
Codeforces (Rating)7177591134182020612029
SWE Verified (Resolved)50.838.842.041.648.949.2
Aider-Polyglot (Acc.)45.316.049.632.961.753.3
Math
AIME 2024 (Pass@1)16.09.339.263.679.279.8
MATH-500 (Pass@1)78.374.690.290.096.497.3
CNMO 2024 (Pass@1)13.110.843.267.6-78.8
Chinese
CLUEWSC (EM)85.487.990.989.9-92.8
C-Eval (EM)76.776.086.568.9-91.8
C-SimpleQA (Correct)55.458.768.040.3-63.7

在最新竞赛(AIME 2025、AMC 12 2024)上的结果进一步验证了其泛化能力:

表 3:最新数学竞赛表现

Average ScoreAMC 12 2024AIME 2025USAMO Index
Human Participants61.76.2/15123.7-
GPT-4o-051384.02.0/15104.0-
DeepSeek V398.33.3/15131.3-
OpenAI o1-1217141.012.0/15261.0-
DeepSeek R1143.711.3/15256.7-

5.2 模型蒸馏

为了以更低成本普及强推理能力,DeepSeek-R1 将推理能力蒸馏到更小的开源模型中。蒸馏使用约 800k 条由 DeepSeek-R1 生成的数据,仅进行 SFT,不加入 RL 阶段。

表 4:蒸馏模型及其基座与初始学习率

Distilled ModelBase ModelInitial Learning Rate
DeepSeek-R1-Distill-Qwen-1.5BQwen2.5-Math-1.5B$1\times10^{-4}$
DeepSeek-R1-Distill-Qwen-7BQwen2.5-Math-7B$8\times10^{-5}$
DeepSeek-R1-Distill-Qwen-14BQwen2.5-14B$7\times10^{-5}$
DeepSeek-R1-Distill-Qwen-32BQwen2.5-32B$6\times10^{-5}$
DeepSeek-R1-Distill-Llama-8BLlama-3.1-8B$5\times10^{-5}$
DeepSeek-R1-Distill-Llama-70BLlama-3.3-70B-Instruct$2\times10^{-5}$

表 5:蒸馏模型在推理基准上的表现

ModelAIME 2024 pass@1cons@64MATH-500 pass@1GPQA Diamond pass@1LiveCodeBench pass@1Codeforces rating
GPT-4o-05139.313.474.649.932.9759
Claude-3.5-Sonnet-102216.026.778.365.038.9717
DeepSeek-R1-Distill-Qwen-1.5B28.952.783.933.816.9954
DeepSeek-R1-Distill-Qwen-7B55.583.392.849.137.61189
DeepSeek-R1-Distill-Qwen-14B69.780.093.959.153.11481
DeepSeek-R1-Distill-Qwen-32B72.683.394.362.157.21691
DeepSeek-R1-Distill-Llama-8B50.480.089.149.039.61205
DeepSeek-R1-Distill-Llama-70B70.086.794.565.257.51633

实验表明,蒸馏后的小模型在推理任务上显著超越原始指令微调版本。例如,仅 1.5B 参数的蒸馏模型在数学基准上已超过 GPT-4o 和 Claude-3.5-Sonnet。

5.3 训练成本与开源

表 6:DeepSeek-R1 训练成本(以 H800 每小时 2 美元估算)

Training CostsDeepSeek-R1-ZeroSFT data creationDeepSeek-R1Total
H800 GPU Hours101K5K41K147K
USD$202K$10K$82K$294K

DeepSeek-R1、DeepSeek-R1-Zero 以及蒸馏模型均已开源,推动长链式推理(Long CoT)研究的进一步发展。


6. 局限、安全与未来方向

6.1 主要局限

  • 结构化输出与工具使用:DeepSeek-R1 在结构化输出和利用外部工具(如搜索引擎、计算器)方面仍有提升空间。
  • Token 效率:模型会根据问题难度动态分配计算量,但简单问题上仍存在“过度思考”现象。
  • 语言混合:当前模型主要针对中文和英文优化,处理其他语言时可能出现语言混用。
  • Prompt 敏感性:Few-shot 提示通常会降低其性能,建议使用 zero-shot 设置。
  • 软件工程任务:由于长评估时间影响 RL 效率,DeepSeek-R1 在软件工程基准上提升有限。
  • Reward Hacking:纯 RL 依赖可靠的奖励信号;对于难以定义规则奖励的任务(如写作),模型可能利用奖励漏洞。

6.2 安全

DeepSeek-R1 配备了基于 DeepSeek-V3 的风险控制系统,通过关键词过滤和模型级风险审查提升安全性。评估显示,结合风险控制系统后,模型在多语言安全和抗 jailbreak 攻击方面达到较高水平。

6.3 未来方向

  • 构建更鲁棒的奖励模型,扩展纯 RL 可处理的任务范围;
  • 引入工具增强推理(如编译器、搜索引擎、实验验证);
  • 提升 token 效率,减少过度推理;
  • 扩展多语言支持与软件工程任务上的 RL 训练。

原文来源

DeepSeek-AI. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. arXiv:2501.12948v2 [cs.CL], 2025.

原文链接

https://arxiv.org/pdf/2501.12948.pdf

相关文章

大模型与架构

大语言模型是怎么工作的?

大语言模型工作原理深度解析:从Transformer架构到预训练、微调、推理的完整技术链路。

阅读更多
大模型与架构

Prompt Engineering 技巧大全

Prompt Engineering技巧大全:链式思考、少样本学习、角色设定等高级提示工程方法论。

阅读更多
大模型与架构

Transformer 架构详解:从 Attention 机制到行业范式

本文全面解析Transformer:首个完全基于注意力机制的序列转换模型。文章先对比RNN/CNN的不足,再介绍编码器-解码器架构、多头自注意力、Scaled Dot-Product Attention、位置编码与训练细节,最后给出WMT机器翻译实验结果,说明其训练效率与翻译质量优势。

阅读更多