中文

R$^2$-Searcher:校准智能体搜索的检索与推理边界

信息检索 2026-06-26 v1

摘要

近期用于多跳推理的搜索智能体常常因为检索不完整的证据或对检索内容中不相关部分进行推理而失败,导致检索-推理边界偏移。我们提出 R2^2-Searcher,这是一个新颖的框架,通过细粒度的、查询 token 引导的证据建模和检索后反思,显式地探索和校准检索与推理边界。具体而言,R2^2-Searcher:(1) 通过基于查询 token 语义(例如,主语、动作、时间标记和程度修饰语)从检索内容中提取精确事实来构建细粒度推理上下文,从而引导搜索智能体的注意力;(2) 引入检索反思机制,在每个检索步骤后评估并纠正边界偏差,引导生成基于所提取推理上下文的改进查询;(3) 采用端到端推理反思引导的强化学习算法 R2^2PO,通过对推理区域和反思的基于树的探索来联合优化两个边界。我们的方法显著提升了检索和推理的质量,建立了一个检索与推理相互增强的迭代循环。在七个复杂多跳问答基准上的广泛实验表明,R2^2-Searcher 在答案准确率和检索-推理质量上均显著优于 SOTA 智能体搜索方法。消融研究进一步证实了检索-推理边界校准的关键作用。

关键词

引用

@article{arxiv.2606.28566,
  title  = {R$^2$-Searcher: Calibrating Retrieval and Reasoning Boundaries for Agentic Search},
  author = {Sheng Zhang and Junyi Li and Wenlin Zhang and Xiaowei Qian and Yichao Wang and Yingyi Zhang and Maolin Wang and Yong Liu and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2606.28566},
  year   = {2026}
}