CuSearch:面向智能体 RAG 的基于搜索深度的课程式轨迹采样
人工智能
2026-05-15 v2
摘要
基于可验证奖励的强化学习(RLVR)已成为一种有前景的范式,用于从仅结果监督中训练智能体检索增强生成(RAG)系统。大多数现有方法从均匀采样的轨迹中优化策略,隐式地将所有轨迹视为同等信息量。然而,轨迹在搜索深度上差异显著,因此信息量并不相同:更深搜索的轨迹包含更多检索决策点,并为检索子策略提供更密集的直接监督。此外,随着训练过程中批次内深度分布向更高值偏移,这种异质性会增长,但均匀轨迹采样仍然对这种偏移视而不见。为了解决这个问题,我们提出了 CuSearch,一个基于搜索深度贪婪分配(SDGA)的课程式轨迹采样框架。SDGA 是一种批次级算子,它将固定的更新预算重新分配给更深搜索的轨迹。SDGA-Auto 始终针对当前批次中最深的可用轨迹,随着深度分布上移,产生一个隐式的训练对齐课程。SDGA-Phase 在更深轨迹变得足够丰富时显式地推进课程阈值。跨模型类型和检索框架的实验表明,CuSearch 持续提升性能,在 ZeroSearch 上比标准 GRPO 高出多达 11.8 个精确匹配点。这些结果确立了每个轨迹的搜索深度作为 RLVR 基智能体 RAG 训练中检索监督密度的可靠、无需标注的代理指标。
引用
@article{arxiv.2605.11611,
title = {CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG},
author = {Jianghan Shen and Siqi Luo and Xinyu Cheng and Jing Xiong and Yue Li and Jiyao Liu and Jiashi Lin and Yirong Chen and Junjun He},
journal= {arXiv preprint arXiv:2605.11611},
year = {2026}
}