中文

PPO、GRPO 和 DAPO 用于 LLM 推理提升的比较分析与参数调优

人工智能 2025-12-09 v1 机器学习

摘要

本研究系统比较了三种强化学习(RL)算法(PPO、GRPO 和 DAPO)用于提高大语言模型(LLM)的复杂推理能力。我们的主要贡献是进行受控的迁移学习评估:首先在专门的 Countdown Game 上对模型进行微调,然后在一套通用推理基准上进行评估。在所有任务中,RL 训练的模型均优于其对应的 base 模型,尽管提升幅度因基准而异。我们的参数分析提供了实用的 RL 基于 LLM 训练指导。增加 GRPO 和 DAPO 中的 group size 可实现更稳定的训练动力学并提升准确率,而 KL-惩罚系数的影响呈非单调变化。此外,我们发现 DAPO 中的 Dynamic Sampling(DS) 组件并不能提升性能;事实上,最佳整体结果是在禁用 DS 时使用 DAPO 实现的。

关键词

引用

@article{arxiv.2512.07611,
  title  = {Comparative Analysis and Parametric Tuning of PPO, GRPO, and DAPO for LLM Reasoning Enhancement},
  author = {Yongsheng Lian},
  journal= {arXiv preprint arXiv:2512.07611},
  year   = {2025}
}