TreeRPO:树形相对策略优化
机器学习
2025-09-30 v2 人工智能
摘要
大型语言模型(LLM)通过强化学习可验证奖励(RLVR)方法展现出惊人的推理能力。然而,现有方法的一个关键局限是,定义在完整轨迹层面的奖励为优化推理过程的中间步骤提供了不足的指导。为此,我们提出一种 novel 方法,通过树形抽样估计 various reasoning 步骤处的数学期望奖励。不同于依赖单独步骤奖励模型的先前方法,TreeRPO 直接通过该抽样过程估计这些奖励。基于 GRPO 的组相对奖励训练机制,TreeRPO 创新性地计算基于树形抽样期间生成的步骤级别组的奖励。这一突破性进展使得 TreeRPO 能够产生细粒度和稠密的奖励信号,显著增强了学习过程和 LLM 的整体性能。实验结果表明,我们的 TreeRPO 算法在 Qwen-2.5-Math 测试基准上的平均 Pass@1 准确率从19.0%提升至35.5%。此外,TreeRPO 在性能上显著超过 GRPO 2.9%,同时将平均响应长度缩短18.1%,凸显了其有效性和效率。我们的代码将在 https://github.com/yangzhch6/TreeRPO 上公开。
引用
@article{arxiv.2506.05183,
title = {TreeRPO: Tree Relative Policy Optimization},
author = {Zhicheng Yang and Zhijiang Guo and Yinya Huang and Xiaodan Liang and Yiwei Wang and Jing Tang},
journal= {arXiv preprint arXiv:2506.05183},
year = {2025}
}
备注
13pages, 6 figures