ReSearch:通过强化学习训练大语言模型学会结合搜索进行推理
人工智能
2025-09-24 v3 计算与语言
摘要
大语言模型(LLMs)在推理方面已展现出卓越的能力,OpenAI-o1 与 DeepSeek-R1 的成功即为明证。然而,将推理与外部搜索过程相结合仍具挑战,尤其对于需要多步检索的复杂多跳问题。我们提出 ReSearch,一种通过强化学习训练 LLMs 结合搜索进行推理的新框架,且不使用任何关于推理步骤的监督数据。我们的方法将搜索操作视为推理链的组成部分,其中何时以及如何执行搜索由基于文本的思考引导,搜索结果则进一步影响后续推理。我们在 Qwen2.5-7B(-Instruct) 与 Qwen2.5-32B(-Instruct) 模型上训练 ReSearch 并进行了广泛实验。尽管仅在一个数据集上进行训练,我们的模型在各类基准上均展现出强大的泛化能力。分析表明,ReSearch 在强化学习过程中自然地激发了反思与自我纠错等高级推理能力。
引用
@article{arxiv.2503.19470,
title = {ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning},
author = {Mingyang Chen and Linzhuang Sun and Tianpeng Li and Haoze Sun and Yijie Zhou and Chenzheng Zhu and Haofen Wang and Jeff Z. Pan and Wen Zhang and Huajun Chen and Fan Yang and Zenan Zhou and Weipeng Chen},
journal= {arXiv preprint arXiv:2503.19470},
year = {2025}
}
备注
Accepted to NeurIPS 2025