中文

CoSearch:基于强化学习的联合推理与文档排序

人工智能 2026-04-23 v2 计算与语言 信息检索

摘要

Agentic search——即训练迭代推理、发布查询并综合检索信息以回答复杂问题的智能体——通过强化学习(RL)取得了显著进展。然而,现有方法如 Search-R1 将检索系统视为固定工具,仅优化推理智能体,而检索组件保持不变。一次初步实验表明,召唤者与固定检索系统之间的差距在七个 QA 基准上可达 +26.8% 的相对 F1 提升,表明检索系统是扩大 agentic search 性能关键瓶颈。为此,我们提出 CoSearch,一个通过组相对政策优化(GRPO)联合训练多步骤推理智能体和生成文档排序模型的框架。为启用对排序器进行有效的 GRPO 训练——其输入因推理轨迹而异——我们引入语义分组策略,通过令牌级相似性将子查询聚类,形成无需额外 rollout 的有效优化组。我们进一步设计了组合奖励,将排序质量信号与轨迹级别的结果反馈相结合,为排序器提供即时和长期学习信号。在七个单跳和多跳 QA 基准上的实验表明,我们的方法在强大的基线上实现了持续的改进,消融研究验证了每个设计选择。我们的结果表明,推理智能体和检索系统的联合训练是可行且性能显著,指向了未来搜索智能体的关键要素。

关键词

引用

@article{arxiv.2604.17555,
  title  = {CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search},
  author = {Hansi Zeng and Liam Collins and Bhuvesh Kumar and Neil Shah and Hamed Zamani},
  journal= {arXiv preprint arXiv:2604.17555},
  year   = {2026}
}