推理

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

DAPO 提出了一套完全开源的、基于强化学习的大语言模型推理能力训练系统,在 Qwen2.5-32B 基座模型上通过解耦裁剪与动态采样策略,在 AIME 2024 数学竞赛题上达到 50 分,并公开了算法细节、训练代码与数据集。

arXiv 2503.14476Qiying Yu, Zheng Zhang, Ruofei Zhu, Yufeng Yuan, Xiaochen Zuo, Yu Yue

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

一句话概括

DAPO 提出了一套完全开源的、基于强化学习的大语言模型推理能力训练系统,在 Qwen2.5-32B 基座模型上通过解耦裁剪与动态采样策略,在 AIME 2024 数学竞赛题上达到 50 分,并公开了算法细节、训练代码与数据集。

问题背景

近年来,大语言模型(LLM)在复杂推理任务上取得了突破性进展,其中“推理缩放”(inference scaling)被认为是关键驱动力——即通过增加推理时的计算量来提升模型在数学、编程等需要多步逻辑推导的任务上的表现。强化学习(RL)被证明是激发这种复杂推理能力的核心技术,OpenAI 的 o1 系列和 DeepSeek 的 R1 模型都依赖 RL 训练来获得强大的推理链生成能力。

然而,这些最先进系统的技术细节被严格保密。OpenAI 的 o1 仅以博客形式发布,DeepSeek R1 的技术报告也隐去了关键的 RL 训练参数和实现细节。这导致学术界和工业界的研究者难以复现类似的结果,也无法深入理解 RL 训练在大规模 LLM 上成功的关键因素。社区迫切需要一套完整、可复现的开源方案,来推动 LLM 推理能力研究的进一步发展。

DAPO 正是针对这一痛点而设计:它不仅要提出一个性能优异的算法,更重要的是将整个训练系统——包括算法细节、代码框架、数据集——全部开源,让研究者能够真正“动手”复现和扩展。

方法要点

DAPO 的核心是一个名为“解耦裁剪与动态采样策略优化”(Decoupled Clip and Dynamic Sampling Policy Optimization)的 RL 算法。它基于经典的 PPO(近端策略优化)框架,但引入了四项关键技术改进:

  1. 解耦裁剪(Decoupled Clip):在标准 PPO 中,策略更新时会对概率比进行裁剪,以防止更新幅度过大。DAPO 将裁剪操作解耦为两个独立的部分——一个用于正向更新(增加好动作的概率),一个用于负向更新(降低差动作的概率)。这样允许算法对“好”和“坏”的样本采用不同的更新步长,避免因统一裁剪而限制了对高质量样本的学习。

  2. 动态采样(Dynamic Sampling):在 RL 训练中,模型会生成大量推理路径。DAPO 根据当前策略的奖励分布动态调整采样策略:当模型表现较好时,减少采样数量以节省计算资源;当模型表现较差时,增加采样以探索更多可能路径。这类似于一种自适应的计算预算分配。

  3. 奖励归一化与裁剪:对奖励信号进行跨批次归一化,并裁剪极端奖励值,以稳定训练过程。这防止了少数异常样本对梯度更新的主导。

  4. 基于 verl 框架的工程实现:DAPO 的代码构建在开源 RL 框架 verl 之上,并针对大规模分布式训练进行了优化,包括高效的奖励计算、梯度同步和模型参数更新。

此外,作者还精心整理并开源了一个训练数据集,确保数据质量与任务多样性。

关键结论(仅基于摘要可合理推断的部分;不确定处标明「摘要未给出」)

  • 性能表现:使用 Qwen2.5-32B 作为基座模型,DAPO 在 AIME 2024 数学竞赛题上达到 50 分。摘要未给出与其他模型(如 DeepSeek R1 或 OpenAI o1)在相同基准上的直接对比分数,也未说明该分数是单次运行还是多次平均结果。
  • 算法有效性:四项关键技术(解耦裁剪、动态采样、奖励归一化、工程优化)共同构成了大规模 LLM RL 训练成功的关键。摘要未给出每项技术的消融实验结果,因此无法判断各技术的相对贡献。
  • 开源范围:完整训练代码、数据集以及算法细节均已开源,基于 verl 框架构建。摘要未给出代码库的具体链接或许可证类型。
  • 可复现性:作者声称系统“增强了可复现性”,但摘要未给出其他研究者在不同硬件或基座模型上的复现结果。

读后思考 / 适用场景

DAPO 最直接的贡献是填补了 LLM 推理 RL 训练的开源空白。对于研究者而言,它提供了一个“可运行、可修改、可分析”的基线系统,可以在此基础上探索新的奖励设计、采样策略或模型架构。对于工程师而言,DAPO 的工程优化(如动态采样)直接降低了训练成本,使得在有限算力下尝试 RL 训练成为可能。

适用场景包括:

  • 数学推理:AIME、MATH、GSM8K 等需要多步推导的任务。
  • 编程竞赛:Codeforces、LeetCode 等需要生成并验证代码的场景。
  • 科学推理:需要逻辑链和假设检验的领域(如物理、化学问题)。
  • 教育领域:训练能够生成逐步解题过程的 AI 辅导系统。

此外,DAPO 的开源精神值得赞赏——它打破了“闭源黑盒”的壁垒,让社区能够真正理解 RL 训练中哪些设计是必要的,哪些只是工程上的巧合。

局限与开放问题

尽管 DAPO 在 AIME 2024 上取得了 50 分,但仍有几个关键问题未在摘要中回答:

  1. 泛化能力:DAPO 是否只在数学推理上有效?在编程、常识推理或开放域问答上的表现如何?摘要未给出
  2. 基座模型依赖性:Qwen2.5-32B 本身已经是一个强大的基座模型。DAPO 的 RL 训练在更小的模型(如 7B)或不同架构(如 LLaMA)上是否同样有效?摘要未给出
  3. 训练成本:达到 50 分需要多少 GPU 小时?动态采样实际节省了多少计算资源?摘要未给出
  4. 奖励设计:DAPO 使用的奖励函数是什么?是简单的正确/错误二元奖励,还是包含过程奖励(process reward)?摘要未给出
  5. 与 DeepSeek R1 的对比:DeepSeek R1 在相同基座模型上的表现如何?DAPO 是否超越了它?摘要未给出
  6. 过拟合风险:在 AIME 这类固定题库上训练,模型是否会记忆答案而非真正学会推理?摘要未给出泛化到新题目的测试结果。

这些问题都需要在阅读全文或实际复现后才能得到解答。但无论如何,DAPO 的开源系统为社区提供了一个宝贵的起点——它让“如何用 RL 训练 LLM 推理”不再是一个黑盒,而是一个可以亲手调试、改进和理解的工程问题。

本页为科普精读;细节以 arXiv 原文为准。下方助手仅就本篇材料答疑。

论文问答

已加载本篇精读与原文摘录;回答为科普性质。

加载中…