中文

通过对比动态分支抽样训练多轮搜索代理

计算与语言 2026-02-04 v1

摘要

代理式强化学习已使大型语言模型能够执行复杂的多轮规划和工具使用。然而,在长时段设置中学习仍然具有挑战性,due to 稀疏的、轨迹级别的结果奖励。虽然先前的基于树的方法试图缓解此问题,但常常 suffer from 高方差和计算效率低下。通过对搜索代理的经验分析,我们识别出一种常见模式:性能差异主要源于尾部的决策。针对这一观察,我们提出了分支相对策略优化 (BranPO),一种无价值函数的方法,通过对比监督提供步骤级别的监督,而无需密集奖励。BranPO 在尾部处截断轨迹,并重新抽样备用 continuation 以构建共享前缀上的对比后缀,减少长时段 rollout 中的信用歧义。为进一步提升效率和训练稳定性,我们引入难度感知的分支抽样以跨任务调整分支频率,以及冗余步骤遮盖以抑制无信息动作。广泛的实验在各种问答基准上表明,BranPO 在多个基线上均表现出色,在不增加总体训练预算的情况下,实现了在长时段任务上的显著精度提升。我们的代码可在 \href{https://github.com/YubaoZhao/BranPO}{code} 上获取。

关键词

引用

@article{arxiv.2602.03719,
  title  = {Training Multi-Turn Search Agent via Contrastive Dynamic Branch Sampling},
  author = {Yubao Zhao and Weiquan Huang and Sudong Wang and Ruochen Zhao and Chen Chen and Yao Shu and Chengwei Qin},
  journal= {arXiv preprint arXiv:2602.03719},
  year   = {2026}
}

备注

24 pages, 5 figures