中文

R-Search:通过多奖励强化学习赋能LLM推理与搜索

计算与语言 2025-06-05 v1

摘要

大语言模型(LLM)在多步和长链推理方面取得了显著进展。然而,将它们的推理能力扩展到涵盖与搜索的深度交互仍然是一个非平凡的挑战,因为模型往往无法识别最优的推理-搜索交互轨迹,从而导致次优响应。我们提出R-Search,一个用于推理-搜索集成的新型强化学习框架,旨在使LLM能够自主执行多步推理并进行深度搜索交互,并通过多奖励信号学习最优的推理-搜索交互轨迹,从而在复杂的逻辑和知识密集型任务中提升响应质量。R-Search引导LLM动态决定何时检索或推理,同时全局整合关键证据以增强推理与搜索之间的深度知识交互。在RL训练期间,R-Search提供多阶段、多类型的奖励以联合优化推理-搜索轨迹。在七个数据集上的实验表明,R-Search在领域内超越了先进的RAG基线高达32.2%,在领域外超越了25.1%。代码和数据可在https://github.com/QingFei1/R-Search获取。

关键词

引用

@article{arxiv.2506.04185,
  title  = {R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning},
  author = {Qingfei Zhao and Ruobing Wang and Dingling Xu and Daren Zha and Limin Liu},
  journal= {arXiv preprint arXiv:2506.04185},
  year   = {2025}
}

备注

16 pages, 3 figures