中文

R1-Searcher:通过强化学习激发 LLM 的搜索能力

人工智能 2025-03-19 v2 计算与语言 信息检索

摘要

现有的大型推理模型(LRM)已展现出强化学习(RL)在增强大型语言模型(LLM)复杂推理能力方面的潜力。尽管它们在数学和编程等具有挑战性的任务上取得了显著性能,但往往依赖内部知识来解决问题,这对于时间敏感或知识密集型问题可能是不够的,从而导致不准确和幻觉。为了解决这一问题,我们提出了 \textbf{R1-Searcher},一种新颖的两阶段基于结果的 RL 方法,旨在增强 LLM 的搜索能力。该方法允许 LLM 在推理过程中自主调用外部搜索系统以获取额外知识。我们的框架完全依赖 RL,无需过程奖励或冷启动蒸馏。我们的实验表明,我们的方法显著优于以往强大的 RAG 方法,甚至与闭源的 GPT-4o-mini 相比也表现出色。

关键词

引用

@article{arxiv.2503.05592,
  title  = {R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning},
  author = {Huatong Song and Jinhao Jiang and Yingqian Min and Jie Chen and Zhipeng Chen and Wayne Xin Zhao and Lei Fang and Ji-Rong Wen},
  journal= {arXiv preprint arXiv:2503.05592},
  year   = {2025}
}