检索、奖励与训练协议:训练搜索代理的关键因素
计算与语言
2026-05-28 v1
摘要
由大型语言模型驱动的搜索代理可以通过多步推理自主分解查询、检索信息并综合答案。然而,训练方法的快速增长已超越了受控比较:现有工作在检索语料库、奖励设计和训练协议上各不相同,使得实际驱动改进的因素变得不明确。我们提出了一项受控实证研究,该研究隔离了搜索代理训练中三个未被充分探索的维度。首先,我们识别了广泛使用的 Wikipedia 2018 语料库中的一个关键数据覆盖问题,并表明仅纠正该问题就能带来比训练算法之间差异更大的收益。其次,我们系统地比较了三种基础模型上基于结果和基于过程的奖励方法,发现最简单的基于结果的方法在大多数设置中达到了具有竞争力或更优的性能,并且过程级别的信用分配可能会过度纠正代理行为。第三,我们分析了训练数据多样性、离策略数据利用和搜索预算缩放,提炼出训练有效搜索代理的实用指南。我们的代码可在 https://github.com/YiboZhao624/SearchAgentReview 获取。
引用
@article{arxiv.2605.27881,
title = {Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?},
author = {Yibo Zhao and Zichen Ding and Jiayi Wu and Zun Wang and Xiang Li},
journal= {arXiv preprint arXiv:2605.27881},
year = {2026}
}
备注
18pages, 4 figures, and 15 tables