中文

基于前瞻树的 rollouts 以提升强化学习中轨迹级探索的效果——针对可验证奖励的 RL

计算与语言 2026-03-03 v3

摘要

强化学习与可验证奖励 (RLVR),特别是以Group Relative Policy Optimization (GRPO) 等算法为例,已被证明在增强大型语言模型推理能力方面非常有效。然而,当前管道中的一个关键瓶颈在于,组 rollouts 中抽样轨迹的多样性有限。均质轨迹及其相关奖励会削弱策略更新的反馈信号,从而阻碍有效的策略学习。这种多样性不足主要源于基于标记的随机抽样,在局部变异可能坍缩为近似相同的推理路径。为此,我们提出了前瞻树基于 rollouts (LATR),这是一种旨在通过强制分支到可能产生不同后续轨迹的不同候选标记,从而显式促进轨迹级多样性的新型 rollouts 策略。具体而言,LATR 在三个阶段迭代运行:(1) 在高不确定性生成步骤进行分支;(2) 对每个新分支进行前瞻模拟;(3) 对在模拟期间表现持续相似性的分支进行修剪。与随机抽样相比,LATR 在GRPO和Dynamic sAmpling Policy Optimization (DAPO) 等算法上平均加快131%的策略学习速度,并在不同推理任务上提升最终 pass@1 性能4.2%。我们的代码和数据已公开于 https://github.com/starreeze/latr。

关键词

引用

@article{arxiv.2510.24302,
  title  = {Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards},
  author = {Shangyu Xing and Siyuan Wang and Chenyuan Yang and Xinyu Dai and Xiang Ren},
  journal= {arXiv preprint arXiv:2510.24302},
  year   = {2026}
}