阅读深度

LLM 强化学习速览(RL for LLMs,2017 ~ 2026)

GRPO → GSPO / GEPO → DAPO 这条线 + credit assignment + on-policy 蒸馏(GKD/SDPO/SDFT/OPD/OPSD/MOPD)· 挑重点:节点性文章 + 知名 repo 已实现的算法 · 检索时间 2026-08-23 · 每篇 = 配方 + 一句话

零基础读法:先把「强化学习训练语言模型」拆成五件事

定义:语言模型已经会用 next-token 预测说话,但用户希望它「答案更正确、更符合偏好、推理更靠谱」。RL for LLMs 就是在已有模型基础上,用奖励或偏好信号再调一步。

方法:一条路是显式 RL,先定义奖励,再优化策略;另一条路是 DPO,把偏好对直接变成分类损失,不用单独训奖励模型。现在主流常把奖励分成结果奖励和过程奖励,决定信号是 response 级还是 token 级。

模型:基础模型通常先 SFT,再 RL。代表产品/方法包括 InstructGPT/RLHF、DeepSeek-R1、Kimi k1.5;算法层有 PPO、GRPO、DAPO、GSPO/GEPO。

算法:PPO 用价值模型算优势;GRPO 干脆不要价值模型,对同一个 prompt 采样一组答案,用组内均值和标准差做相对优势;DAPO 再修 clip、动态采样和 token 级损失。后来还有 on-policy 蒸馏,用强 teacher 的 token 分布替代稀疏奖励。

评测:数学/代码看 AIME、MATH、LiveCodeBench;通用能力看 MMLU;工程上还看训练稳定性、KL 漂移、长度膨胀和采样效率。只看分数不够,还要看奖励是不是被 hack。

读每篇时抓住两问:奖励从哪里来?奖励/优势分到 response 还是 token?

0. 记法(这个领域的「最大公约数」)

LLM 强化学习的核心问题只有两个:用什么信号(奖励从哪来)和把信号分给谁(credit assignment)。所有算法都在回答「advantage 怎么算、奖励/优势分到 response 级还是 token 级」。配方围绕这两轴:

记号意思
pg / advantage策略梯度 / 优势函数 A(这个动作比平均好多少)
critic价值模型 V,用来估 baseline / 优势(PPO 用)
critic-free不要价值模型(GRPO/RLOO/DAPO),省训练开销
group组内相对:同 prompt 采样一组,用组内均值/方差归一化 advantage
clip / KL信任域:clip 比例限制更新幅度 / KL 惩罚保持离参考策略不远
orm / prm结果奖励(outcome)/ 过程奖励(process),后者给 token 级监督
creditcredit assignment:奖励/优势分到 response 级还是 token 级
on-policy distillon-policy 蒸馏:在 student 自己采的 rollout 上做 token 级蒸馏(GKD/SDPO/SDFT/OPD/OPSD/MOPD)

配方格式:算法 -> 优化目标 + advantage/credit 来源。例:GRPO: critic-free group -> 组内标准化 advantage + clip [无 value model]。

一句话主线:PPO 需要价值模型(贵)→ GRPO 用「同 prompt 采一组、组内比」甩掉价值模型(DeepSeek-R1 用)→ DAPO/GSPO/GEPO 修 GRPO 的 clip、长度偏置、credit → 最近 GKD/SDPO/SDFT/OPD/OPSD/MOPD 干脆不用 RL 信号、改用「强 teacher 的 token 级蒸馏」。信号从「人类偏好」一路走到「可验证奖励」再到「teacher 分布」。

1. 主线:信号来源的三次迁移

  1. 人类偏好(2017-2022):PPO + 奖励模型(RLHF/InstructGPT),DPO 把「先学奖励再优化」合成一步。
  2. 可验证奖励 + 组内相对(2024-2025):GRPO 用「同 prompt 采一组、组内标准化」甩掉价值模型,配可验证奖励(代码能跑/答案可判),DeepSeek-R1 引爆推理 RL。
  3. 修 GRPO + token 级 credit(2025):DAPO 修 clip/采样/长度、GSPO 修序列级 credit、GEPO 修熵、VinePPO/PRIME 把 credit 做到 token 级。
  4. teacher 分布(2023–2026):GKD/SDPO/SDFT/OPD/OPSD/MOPD 用「teacher 或自我 teacher 的 token 级分布」当监督,在 student 自己的 rollout 上蒸馏,信号从「奖励标量」变成「稠密 token 监督」。

一条主轴:信号从「稀疏标量奖励」走向「稠密 token 级监督」,credit assignment 从 response 级走向 token 级。交点是一个开放问题:奖励越稠密越容易训,但「过程对错」本身难定义,PRM 和 on-policy 蒸馏在争「谁给 token 级信号」。

2. 先读这两篇(综述)

按规范先读 survey。一篇给 on-policy 蒸馏(GKD/SDPO/SDFT/OPD/OPSD/MOPD)的统一框架,一篇给 credit assignment 的完整地图。

A Survey of On-Policy Distillation for LLMs(2604.00626,2026)
survey(OPD) -> f-散度统一框架 + 三维分类 [信号 / teacher 访问 / 损失粒度]
问题 GKD/SDPO/SDFT/OPD/OPSD/MOPD 一堆变体、缺统一视角;方法 用 f-散度把 on-policy 蒸馏统一,按「反馈信号(logit/outcome/偏好)、teacher 访问(白盒/黑盒)、损失粒度(response/token)」三维分类;核心 这张「Awesome-LLM-On-Policy-Distillation」树的母论文,是 OPD 线的地图。

3. 奠基(PPO → RLHF → DPO → RLOO)

RL 用于语言模型的四个地基:PPO 给 clip 信任域、RLHF 给「奖励模型 + 人类偏好」范式、DPO 把奖励隐式化、RLOO 证明「不要价值模型也能行」——后者是 GRPO 的前奏。

PPO(Proximal Policy Optimization)(1707.06347,Schulman et al. 2017)
pg + clip -> 稳定策略更新 [clip 信任域 + 价值模型 baseline]
问题 策略梯度更新步长难控、易崩;方法 用 clip 把更新限制在信任域内,配价值模型估 advantage;核心 事实标准的 RL 算法,LLM RL 的起点;后续 RLOO / GRPO 指出价值模型和策略同规模、训练开销翻倍,改成 critic-free——PPO 的 clip 被保留、价值模型这条被逐步弃。

InstructGPT / RLHF(2203.02155,Ouyang et al. 2022,OpenAI)
sft → rm → ppo -> 对齐人类意图 [人类偏好奖励模型]
问题 语言模型没对齐用户意图;方法 三段式:SFT → 训奖励模型(人类偏好排序)→ PPO 优化;核心 确立「RLHF」范式,ChatGPT 的底座;后续 DPO 指出单独训奖励模型 + RL 麻烦且不稳,把奖励隐式化——RLHF 的「奖励模型」组件被多数方法绕开,范式本身被 DPO / RLVR 替代。

DPO(Direct Preference Optimization)(2305.18290,Rafailov et al. 2023)
dpo -> 免奖励模型对齐 [隐式奖励 = $\beta\cdot\log(\pi/\pi_{\mathrm{ref}})$]
问题 RLHF 要单独训奖励模型、再 RL,麻烦且不稳;方法 把奖励模型「隐式化」成 $\beta\cdot\log(\pi/\pi_{\mathrm{ref}})$,直接从偏好对做分类式优化;核心 免奖励模型、免 RL 的对齐范式,是后续自奖励/偏好优化一系列工作的底座;后续 RLVR / on-policy 蒸馏指出静态偏好对在可验证、长 CoT 场景不适用,改成用 rollout 奖励——DPO 的隐式奖励思想被保留,静态偏好对被部分弃。

RLOO(REINFORCE Leave-One-Out)(2402.14740,Ahmadian et al. 2024)
pg(leave-one-out) -> 免价值模型 [同组其余样本当 baseline]
问题 一定要价值模型吗;方法 用「组内其余样本的均值」当 baseline,做 REINFORCE,无价值模型、无偏;核心 证明 critic-free 也能追平 PPO,是 GRPO 的直接前奏(TRL 已实现);后续 GRPO 指出 leave-one-out baseline 不如组内标准化 advantage 稳,改成按 prompt 组内均值/标准差归一——RLOO 的 critic-free 思想被继承、baseline 被改。

4. GRPO 这条线(critic-free 的主流)

GRPO 用「同 prompt 采一组、组内标准化 advantage」彻底甩掉价值模型,配可验证奖励,成为 DeepSeek-R1 的引擎。之后的 DAPO/GSPO/GEPO 都在修它:clip 不对称、长度偏置、序列级 credit、熵控制。这节是当前 LLM RL 的主干,绝大多数已进 verl/TRL。

GRPO(Group Relative Policy Optimization,DeepSeekMath)(2402.03300,Shao et al. 2024)
critic-free group -> 组内标准化 advantage + clip [无价值模型]
问题 PPO 的价值模型和策略同规模、训练开销翻倍;方法 对每个 prompt 采样一组输出,用组内奖励的均值/标准差做相对优势,只更新策略、不训价值模型;核心 「组内相对」范式,DeepSeek-R1 的核心引擎,verl/TRL 都已实现——是这条线的起点。

Dr. GRPO(Understanding R1-Zero-Like Training)(2503.20783,Liu et al. 2025)
analysis -> 指出 GRPO 长度偏置 [优化偏置无偏化]
问题 GRPO 训练里响应越来越长、尤其错答案也变长,是不是病;方法 发现 GRPO 的优化偏置人为拉长输出,提出无偏版本 Dr. GRPO;核心 把「GRPO 长度膨胀」解释清楚,是理解 R1-Zero 式训练的关键批评。

DAPO(Decoupled Clip + Dynamic sAmpling)(2503.14476,Yu et al. 2025,ByteDance/Tsinghua)
critic-free group + clip 解耦 -> 稳定长 CoT RL [非对称 clip + 动态采样 + token 级 + 超长惩罚]
问题 GRPO 在长 CoT 上 entropy collapse、clip 对称不合理、采样效率低;方法 四个技术:非对称 clip(高/低阈值分开)、动态采样(过滤全对/全错的 prompt)、token 级 loss、超长奖励整形;核心 开源(verl)的规模化 RL 系统,Qwen2.5-32B 纯 RL 到 AIME 50 分——是 GRPO 后最重要的工程/算法节点。

GSPO(Group Sequence Policy Optimization)(2507.18071,2025)
critic-free group + 序列级 credit -> 更稳更高效 [序列级重要性采样]
问题 GRPO 把奖励均分到每个 token、credit 不精细,且训练不稳;方法 提出「组序列」策略优化,用序列级重要性采样做更细的 credit assignment;核心 GRPO 的强替代,训练效率和稳定性都更好——credit assignment 正式进入「序列/ token 级」讨论。

GEPO(Group Entropy-Controlled Policy Optimization)(2607.16850,2026)
critic-free group + 熵控制 -> 稳定探索 [组内熵 + 非对称 advantage 整形]
问题 GRPO 熵失控、探索和利用失衡;方法 用组内熵(从已有采样免费估)做熵条件的非对称 advantage 整形;核心 GRPO 的轻量扩展,零额外采样成本,能直接嵌进现有 group 方法。

5. 推理 RL 落地(R1 / k1.5)

GRPO + 可验证奖励在真实模型上的两次大规模落地:DeepSeek-R1(纯 RL 出「aha moment」)和 Kimi k1.5(长上下文 + 多模态 + partial rollout)。它们是「算法能不能 scale」的证明。

DeepSeek-R1(2501.12948,DeepSeek-AI 2025)
grpo + 可验证奖励 -> 推理涌现 [R1-Zero 纯 RL + R1 SFT+RL + 蒸馏]
问题 推理能力能不能靠 RL 逼出来;方法 R1-Zero 只做 GRPO + 规则奖励(答案对/格式对),观察到「aha moment」自发长思维链;R1 再冷启动 SFT + RL + 蒸馏;核心 证明「纯 RL + 可验证奖励」能 scale 出推理,GRPO 从论文走向工业,是整条线的引爆点。

Kimi k1.5(2501.12599,Moonshot 2025)
rl(长 CoT + partial rollout) -> 长上下文 RL [长度惩罚 + 多模态 + 课程]
问题 怎么在大规模、长上下文、多模态上把 RL 训稳;方法 长 CoT、partial rollout、长度惩罚、多模态联合、课程学习;核心 和 R1 同期把 RL 推理 scale 到长上下文 + 多模态,补充了 R1 没细讲的部分。

6. Credit assignment(奖励分到 response 级还是 token 级)

GRPO 默认把组内优势均分到整条 response 的所有 token,这是「粗粒度 credit」。这条线问:能不能把奖励/优势分到「过程」甚至「单个 token」?PRM 给过程监督、VinePPO 用 MC 估 token 价值、PRIME 用隐式过程奖励、DelTA 做判别式 token credit。核心矛盾:token 级更准,但「过程对错」本身难定义。

PRM(Let's Verify Step by Step)(2305.20050,Lightman et al. 2023,OpenAI)
prm -> 过程级监督 [逐步验证器]
问题 结果奖励太稀疏,中间步骤对不对没信号;方法 训练「过程奖励模型」给每一步打分,替代只给最终结果的结果奖励;核心 process vs outcome 的经典对照,过程监督是 token 级 credit 的源头(需人工逐步标注,贵)。

VinePPO(2410.01679,Kazemnejad et al. 2024,ICML 2025)
pg + MC 价值 -> 无偏 token 级 credit [MC 估值替代价值网络]
问题 价值网络估优势有偏、还慢,能不能既 token 级又无偏;方法 用语言环境的灵活性做无偏蒙特卡洛估值,替代价值网络,把 credit 精化到 token 级;核心 「不丢 PPO 的 credit 精度」的代表,KL 权衡好 3 倍。

PRIME(Process Reinforcement through Implicit Rewards)(2502.01456,Cui et al. 2025)
prm(隐式) -> 免人工标注的过程奖励 [用结果标签在线更新 PRM]
问题 过程奖励要人工逐步标注、太贵;方法 只用策略 rollout 和结果标签,学「隐式过程奖励」,PRM 在线更新;核心 把过程监督的成本打下来,过程奖励不用人工标注。

DelTA(Discriminative Token Credit Assignment)(2605.21467,2026)
credit(判别式 token) -> 可验证奖励的 token 级 credit [判别哪些 token 关键]
问题 可验证奖励只有结果对/错,怎么分到 token;方法 判别式地给 token 分配 credit(区分哪些 token 对最终对错有贡献);核心 2026 年 credit assignment 的最新代表作,回应「token 级 credit」这条线。

7. On-policy 蒸馏(GKD → SDPO / SDFT / OPSD / OPD / MOPD)

这条线从 GKD 开始:别在 teacher 的静态分布上蒸馏,改在 student 自己生成的 rollout 上用 teacher 反馈。最新一波(2026)再把 teacher 换成「模型自己」或「多个领域 teacher」:SDPO 把 RL 的反馈条件 self-teacher 蒸馏回策略,SDFT 用 in-context 示范让模型边学新任务边不遗忘旧技能,OPSD 用特权上下文做自我蒸馏,OPD 解释它到底为什么成立、OPD 也暴露长程 scale 的坑,MOPD 用多个领域 teacher 在策略空间整合能力(DeepSeek-V4、MiMo-V2 都在用)。这波把 LLM 后训练从「RL 优化奖励」推向「on-policy 蒸馏」。

GKD(Generalized Knowledge Distillation / On-Policy Distillation)(2306.13649,Agarwal et al. 2024,ICLR)
on-policy distill(self-generated) -> 学习信号 [teacher 在 student 采样上的反馈 + 灵活散度]
问题 自回归模型的 KD 有 train/inference 分布不一致;方法 student 先自己生成序列,teacher 在这些序列上给反馈,再拿「student 分布 vs teacher 反馈」的散度训练,还能接进 RLHF;核心 on-policy 蒸馏的地基,OPD/OPSD 都是从这里长出来的。

SDPO(Reinforcement Learning via Self-Distillation / Self-Distillation Policy Optimization)(2601.20802,Hübottner et al. 2026)
rl(feedback) -> token 级自我蒸馏目标 [feedback 条件当前模型当 self-teacher]
问题 RLVR 每次 attempt 只有一个标量结果奖励,credit assignment 卡住;方法 把「RL + 富反馈」形式化,让「以反馈为条件的当前模型」当 self-teacher,把它的 feedback-informed 下一个 token 预测蒸馏回 policy;核心 科学推理 / 工具使用 / LiveCodeBench v6 上采样效率和最终准确都更好;只有标量奖励的环境也能用成功 rollout 给失败 rollout 当隐式反馈,test-time 用能 3 倍 fewer attempts 复现 best-of-k。

SDFT(Self-Distillation Enables Continual Learning)(2601.19897,Shenfeld et al. 2026)
sft + on-policy self-distill -> 新任务准确 + 少遗忘 [demonstration 条件模型当自己的 teacher]
问题 持续学习里不能一边学新技能一边忘旧技能,普通 SFT 又是 off-policy;方法 用「以 demonstration 为条件的模型」当自己的 teacher,靠 in-context learning 产生 on-policy 信号做 self-distillation;核心 比 SFT 的新任务准确更高、灾难性遗忘更少,顺序学多个技能能累积而不回退。

OPSD(Self-Distilled Reasoner: On-Policy Self-Distillation)(2601.18734,Zhao et al. 2026)
on-policy distill(self) -> token 级自我蒸馏 [一个模型当 teacher + student,teacher 有特权上下文]
问题 没有更强 teacher 时怎么自我提升;方法 同一个模型当 teacher(给特权上下文/参考答案)和 student(不给),在 student 自己采的 rollout 上做 token 级蒸馏;核心 定义 on-policy self-distillation(OPSD),把「自我改进」变成稠密 token 监督,是 OPD 线的起点。

OPD(Rethinking On-Policy Distillation)(2604.13016,Li et al. 2026)
on-policy distill -> 成功条件 + 训练修复 [学生状态上的高概率 token 对齐 + cold start / prompt 选择]
问题 on-policy 蒸馏什么条件下才真正成功、为什么实际训不稳;方法 指出两个成功条件——student 与 teacher 的思考模式兼容、teacher 必须提供学生没有的新知识;发现同族 1.5B / 7B 弱到强反向蒸馏里,teacher 从学生视角分布不可区分,成功 OPD 靠学生在访问状态上对高概率 token 渐进对齐(少量共享 token 占 97–99% 概率);核心 给出 off-policy cold start 与 teacher-aligned prompt selection 两个修复;但稠密 token 奖励随轨迹深度退化,长程 scale 仍是开放问题。

MOPD(Multi-Teacher On-Policy Distillation)(2606.30406,2026)
on-policy distill(multi-teacher) -> 能力整合 [各领域 teacher 蒸馏进一个 student]
问题 多个领域能力(数学/代码/agent)怎么整合进一个模型,而不在权重/静态数据集里拼;方法 先各领域独立 RL 训出强 teacher,再在策略空间用 on-policy 蒸馏把它们整合进单个 student;核心 多 teacher 能力整合范式,DeepSeek-V4 / MiMo-V2-Flash 的 post-training 都在用。

8. 框架(verl / HybridFlow)

算法能 scale,靠的是框架。verl(HybridFlow)是 GRPO/DAPO/R1 这些算法落地的开源底座,也是「哪些算法被工业界真正用起来」的风向标。

HybridFlow / verl(2409.19256,Sheng et al. 2024)
framework(单控多模型) -> 灵活 RLHF 训练 [异构计算 / 3D 并行]
问题 RLHF 里 actor/critic/ref/reward 模型资源需求不同、框架僵化;方法 单控制器 + 多模型 + 异构计算 + 3D 并行,灵活分配;核心 开源 RL 框架 verl 的技术报告,GRPO/DAPO/R1 大规模训练的实际底座。

9. 共识与分歧(速记版)

共识:

  1. critic-free 的 group 方法(GRPO/DAPO)已成为推理 RL 的事实标准,价值模型基本被甩掉。
  2. 可验证奖励(代码/数学)是最可靠的 RL 信号,R1/k1.5 靠它 scale。
  3. credit assignment 从 response 级走向 token 级是大方向(GSPO/VinePPO/PRIME/DelTA)。
  4. 2026 起 on-policy 蒸馏(GKD/SDPO/SDFT/OPD/OPSD/MOPD)成为后训练新范式,被 DeepSeek-V4 等旗舰采用。

分歧 / 难点:

  1. token 级信号从哪来:PRM(需过程标注/隐式)vs on-policy 蒸馏(teacher 分布)vs MC 估值(VinePPO),三条路争「谁给稠密 credit」。
  2. 过程对错难定义:PRM 的过程奖励本身就可能 reward-hack、被「看起来对」蒙骗。
  3. RL 还是蒸馏:GRPO 线靠「奖励信号」,OPD 线靠「teacher 分布」,两者能否统一(用奖励当 teacher)没有定论。
  4. 长度/熵失控:GRPO 的长度偏置(Dr.GRPO)和熵 collapse(DAPO/GEPO)反复出现,说明 critic-free group 还有内在不稳。
  5. 评测:算法进步和「数据/奖励设计/teacher」的贡献难分离,很多 SOTA 是工程集成的结果。

说明:点名线(GRPO/GSPO/GEPO/DAPO)、credit assignment(PRM/VinePPO/PRIME/DelTA)、GKD/SDPO/SDFT/OPD/OPSD/MOPD 已读摘要/方法,arXiv 号均逐一核对。挑选标准:节点性文章(PPO/RLHF/DPO/GRPO/DAPO/R1)+ 知名 repo(verl/TRL)已实现的算法(RLOO/GRPO/DAPO/GSPO)。agentic RL(tool calling、multi-turn、环境奖励)与本领域高度重合但重心在「轨迹/环境设计」而非「策略优化算法」,建议单独成篇。