ZeroSearch:无需搜索即可激励 LLM 的搜索能力
计算与语言
2026-05-20 v3
摘要
有效的信息搜索是提升大语言模型(LLM)推理与生成能力的关键。近期研究探索利用强化学习(RL)通过与真实搜索引擎交互来提升 LLM 的搜索能力。尽管这些方法显示出鼎舞效果,但面临两个主要挑战:(1)不可控制的文档质量:搜索引擎返回文档的质量往往不可预测,引入噪声并降低训练稳定性。(2)昂贵的 API 成本:RL 训练需要频繁进行 rollout,可能涉及数十万次搜索请求,造成巨大的 API 费用并严重限制可扩展性。为解决这些挑战,我们引入 ZeroSearch,一种新型 RL 框架,用仿真搜索激励 LLM 使用真实搜索引擎的能力。我们的 approach 首先进行轻量级监督微调,将 LLM 转化为能够生成有用或噪声文档的检索模块。在 RL 训练期间,我们采用基于课程的 rollout 策略,逐步降低生成文档的质量,逐步激发模型的推理能力,使其暴露于日益具有挑战性的检索情境。广泛实验表明,ZeroSearch 能有效地激励 3B 参数的 LLM 拥有搜索能力。惊人的是,7B 的检索模块即可实现与真实搜索引擎相当的性能,而 14B 的检索模块甚至超越真实搜索引擎。此外,它在各种参数规模的基础模型和指令微调模型上都能良好泛化,并与多种 RL 算法兼容。
关键词
引用
@article{arxiv.2505.04588,
title = {ZeroSearch: Incentivize the Search Capability of LLMs without Searching},
author = {Hao Sun and Zile Qiao and Jiayan Guo and Xuanbo Fan and Yingyan Hou and Yong Jiang and Pengjun Xie and Yan Zhang and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2505.04588},
year = {2026}
}