中文

基于树形结构的强化学习代理 RAG 过程监督方法-TreePS-RAG

计算与语言 2026-01-13 v1

摘要

代理式检索增强生成(RAG)将问答建模为推理与信息检索之间的多步骤交互,近期通过强化学习(RL)采用结果为导向的方式取得了进展。然而,仅依赖稀疏最终奖励限制了步骤级信用分配,为中间推理和动作提供了弱引导。近期研究探索过程级监督,但通常依赖离线构建的训练数据,存在分布迁移风险,或需要高成本的中间标注。我们提出 TreePS-RAG,一种用于代理式 RAG 的在线、基于树形的 RL 框架,实现步骤级信用分配,同时保留标准的结果奖励。我们的关键思想是将代理式 RAG 推理建模为滚动树结构,其中每个推理步骤自然对应一个节点。该树结构允许通过对其后代结果进行蒙特卡洛估计来估计步骤效用,从而在不需中间标签的情况下获得细粒度的过程优势。为使此范式实用,我们引入高效的在线树构建策略,在受限计算预算下保持探索多样性。相较于 Search-R1 等强基线,TreePS-RAG 在滚动成本上与之相当。在七个多跳及通用问答基准测试中,实验表明 TreePS-RAG 在多个模型规模下均显著优于结果监督和领先的过程监督 RL 方法。

关键词

引用

@article{arxiv.2601.06922,
  title  = {TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG},
  author = {Tianhua Zhang and Kun Li and Junan Li and Yunxiang Li and Hongyin Luo and Xixin Wu and James Glass and Helen Meng},
  journal= {arXiv preprint arXiv:2601.06922},
  year   = {2026}
}