监督搜索过程产生可靠且可泛化的信息检索智能体
计算与语言
2026-05-19 v3 人工智能
摘要
大型语言模型(LLM)正通过从文档排序转向合成答案来变革网络搜索,并日益被部署为与外部知识源进行迭代交互的自主智能体搜索系统。尽管取得了这些进展,构建有效的搜索智能体仍然具有挑战性,因为高质量的中间搜索步骤难以生成。先前的方法主要依赖于结果监督,仅因智能体产生正确的最终答案而给予奖励。这通常会导致奖励黑客行为和对参数化记忆的过度依赖,限制了对域外任务的泛化能力。为了解决这些局限性,我们引入了 RAG-Gym,这是一个将监督从最终答案转移到搜索过程本身的框架。借助 RAG-Gym,我们系统地研究了架构设计、参数优化和动作评估,并确定推理反思是搜索智能体的关键能力。基于这一见解,我们提出了 ReSearch++,一个过程监督智能体,在多跳信息检索基准上取得了显著改进,尤其是在域外设置中。性能提升主要归因于更高质量的搜索查询,而非仅仅依靠答案优化,并且学习到的搜索评论器可跨模型迁移,包括专有 LLM。这些发现表明,监督搜索过程可以产生更可靠且更具泛化能力的信息检索智能体。
引用
@article{arxiv.2502.13957,
title = {Supervising the search process produces reliable and generalizable information-seeking agents},
author = {Guangzhi Xiong and Qiao Jin and Xiao Wang and Yin Fang and Haolin Liu and Yifan Yang and Fangyuan Chen and Zhixing Song and Dengyu Wang and Minjia Zhang and Zhiyong Lu and Aidong Zhang},
journal= {arXiv preprint arXiv:2502.13957},
year = {2026}
}
备注
Homepage: https://rag-gym.github.io; Code: https://github.com/RAG-Gym/RAG-Gym