基于滚动树的步骤级信用分配:RTMC
机器学习
2026-04-14 v1 人工智能
摘要
多步骤智能体强化学习受益于细粒度信用分配,但现有方法选择有限:没有评论家的方法如 GRPO 为轨迹中每个动作分配统一的优势,而学习价值网络则带来显著开销且在稀疏奖励下容易不稳定。我们观察到,针对相同问题的多个分组滚动往往遍历重叠的中间状态,隐式地形成一棵分支在 successive decision points 发散的树。基于此洞察,我们提出滚动树蒙特卡罗(RTMC)优势估计方法,通过聚合共享相同状态的滚动返回统计,生成每个步骤的 Q 值和优势——无需任何学习评论家。一种状态-动作签名系统将原始交互历史压缩为紧凑且可比较的表示,使得跨滚动状态匹配可行。在 SWE-bench Verified 上,RTMC 比 GRPO 在 pass@1 上提升 3.2 个百分点。
引用
@article{arxiv.2604.11037,
title = {RTMC: Step-Level Credit Assignment via Rollout Trees},
author = {Tao Wang and Suhang Zheng and Xiaoxiao Xu},
journal= {arXiv preprint arXiv:2604.11037},
year = {2026}
}