DGRO:通过探查-开发控制与奖励方差管理提升LLM推理能力
机器学习
2025-05-20 v1 人工智能
摘要
推理扩放进一步加速了大型语言模型(Large Language Models, LLMs)通向人工通用智能(Artificial General Intelligence, AGI)的进程,通过大规模强化学习(Reinforcement Learning, RL) unleash long Chain-of-Thought reasoning。目前大多数推理方法都依赖于手工设计的规则驱动奖励函数。然而,RL算法中探查与开发之间的权衡涉及多个复杂考量,手动设计的奖励函数的理论与实证影响仍不充分。本文提出解耦式群体奖励优化(Decoupled Group Reward Optimization, DGRO),一种通用的LLM推理RL算法。一方面,DGRO将传统正则化系数解耦为两个独立超参数:一个缩放策略梯度项,另一个调节采样策略的距离。这种解耦不仅实现对探查与开发的精确平衡,还可无缝扩展至Kimi k1.5和Direct Reward Optimization中的在线策略镜像梯度(Online Policy Mirror Descent, OPMD)算法。另一方面,我们观察到奖励方差显著影响收敛速度与最终模型性能。我们进行理论分析与广泛实证验证评估DGRO,包括详细的消融研究以考察其性能与优化动力学。实验结果表明,DGRO在逻辑数据集上实现最先进性能,平均准确率达96.9%,并在数学基准测试中展现出强大的泛化能力。
引用
@article{arxiv.2505.12951,
title = {DGRO: Enhancing LLM Reasoning via Exploration-Exploitation Control and Reward Variance Management},
author = {Xuerui Su and Liya Guo and Yue Wang and Yi Zhu and Zhiming Ma and Zun Wang and Yuting Liu},
journal= {arXiv preprint arXiv:2505.12951},
year = {2025}
}