DeepDiver:基于开放网络强化学习的自适应搜索强度缩放
计算与语言
2025-11-11 v2
摘要
信息检索需要迭代收集证据和反思推理,然而大型语言模型(LLM)在开放网络问答中仍然难以胜任。现有的提示和监督微调(SFT)方法受限于提示规则或训练语料库,通常仅在结构良好的维基来源上进行基准测试,限制了其在现实世界中的适应性。我们引入了 WebPuzzle,这是一个包含 24k 样本的训练和 275 样本的测试基准,用于在实时互联网上评估信息检索能力,涵盖维基和开放域查询。利用 7k 个 WebPuzzle 实例,我们开发了 DeepDiver,这是一个强化学习(RL)框架,旨在培养搜索强度缩放(SIS)——一种涌现能力,即增加搜索频率和深度,而不是满足于过度自信、证据不足的答案。借助 SIS,Qwen2.5-7B-Instruct 和 Pangu-7B-Reasoner 在真实网络任务上取得了与 671B 参数的 DeepSeek-R1 相当的性能。我们详细介绍了 DeepDiver 从冷启动 SFT 到精心设计的 RL 过程的课程学习,并表明其搜索策略可以从封闭式查询泛化到开放式生成,例如长文本写作。我们的结果推进了 LLM 中的自适应信息检索,并为未来的工作提供了严格的基准。
引用
@article{arxiv.2505.24332,
title = {DeepDiver: Adaptive Search Intensity Scaling via Open-Web Reinforcement Learning},
author = {Wenxuan Shi and Haochen Tan and Chuqiao Kuang and Xiaoguang Li and Xiaozhe Ren and Chen Zhang and Hanting Chen and Yasheng Wang and Lu Hou and Lifeng Shang},
journal= {arXiv preprint arXiv:2505.24332},
year = {2025}
}
备注
Accepted as NeurIPS 2025 Spotlight