GDEPO:面向样本受限强化学习的群体双动态等权优势政策优化及增强数据利用
人工智能
2026-01-23 v3
摘要
自动定理证明(ATP)是人工智能中的一个根本挑战,要求构建机器可验证的形式语言中的证明(如Lean)以评估AI推理能力。强化学习(RL),特别是高性能群体相对政策优化(GRPO)算法,已成为这一任务的主流方法。然而,在ATP场景中,GRPO面临两个关键问题:当采用复合奖励时,其相对优势估计可能与形式验证器的二元反馈冲突;其静态抽样策略若未找到有效证明,将导致数据批次被整体丢弃,造成模型更新的零贡献和显著的数据浪费。为此,我们提出群体双动态等权优势政策优化(GDEPO),其包含三个核心机制:1)动态额外抽样,通过不断抽样无效批次直到发现有效证明;2)等权优势,将优势函数的符号(基于正确性)与其大小(由辅助奖励调制)解耦,确保稳定且正确的策略更新;3)动态额外迭代,对最初失败但最终成功的样本执行额外梯度步骤,以加速对困难案例的学习。在MinF2F-test、MathOlympiadBench和PutnamBench三个难度不同的数据集上进行的实验表明,GDEPO有效提升了数据利用率和优化效率,消化研究验证了其协同组件的必要性。该方法为ATP提供了一种新颖的训练范式。
引用
@article{arxiv.2601.06795,
title = {GDEPO: Group Dual-dynamic and Equal-right Advantage Policy Optimization with Enhanced Training Data Utilization for Sample-Constrained Reinforcement Learning},
author = {Zhengqing Yan and Xinyang Liu and Yi Zhang and Fan Guo and ChengXun Jia and Junchen Wan and Yao Liu and Qi Liu and Jihao Huang and Kang Song},
journal= {arXiv preprint arXiv:2601.06795},
year = {2026}
}