中文

WebSeer:通过自反思强化学习训练更深层的搜索智能体

计算与语言 2025-10-22 v1

摘要

搜索智能体通过强化学习在交互式环境中实现智能信息检索和决策,取得了显著的进展。尽管已有研究运用强化学习训练具备更动态交互检索能力的代理模型,但现有方法受限于工具使用深度浅及跨多次迭代交互的误差累积。本文提出WebSeer,一种通过增强自反思机制的强化学习训练的更智能搜索代理。具体而言,我们构建了标注反思模式的大规模数据集,并设计了两阶段训练框架,在自反思范式下统一冷启动与强化学习,以适应现实Web环境,使模型能够生成更长且更具反思性的工具使用轨迹。我们的方法显著扩展了工具链长度,提高了答案准确率。仅使用单个14B模型,即可在HotpotQA和SimpleQA上取得最新结果,准确率分别达到72.3%和90.0%,并显示出对非分布数据集的强大泛化能力。代码已公开于https://github.com/99hgz/WebSeer

关键词

引用

@article{arxiv.2510.18798,
  title  = {WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection},
  author = {Guanzhong He and Zhen Yang and Jinxin Liu and Bin Xu and Lei Hou and Juanzi Li},
  journal= {arXiv preprint arXiv:2510.18798},
  year   = {2025}
}