R1-Searcher++:通过强化学习激励 LLM 的动态知识获取
计算与语言
2025-05-23 v1 人工智能
信息检索
摘要
大型语言模型(LLMs)功能强大,但由于静态知识容易产生幻觉。检索增强生成(RAG)通过注入外部信息提供帮助,但当前方法通常成本高昂、泛化能力差,或忽略模型的内部知识。在本文中,我们介绍了 R1-Searcher++,这是一个新颖的框架,旨在训练 LLM 自适应地利用内部和外部知识源。R1-Searcher++ 采用两阶段训练策略:初始的 SFT 冷启动阶段用于初步格式学习,随后是用于动态知识获取的强化学习(RL)阶段。RL 阶段使用结果监督来鼓励探索,结合了内部知识利用的奖励机制,并集成了记忆机制以持续吸收检索到的信息,从而丰富模型的内部知识。通过利用内部知识和外部搜索引擎,模型不断提高其能力,实现高效的检索增强推理。我们的实验表明,R1-Searcher++ 优于以前的 RAG 和推理方法,并实现了高效检索。代码可在 https://github.com/RUCAIBox/R1-Searcher-plus 获取。
引用
@article{arxiv.2505.17005,
title = {R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning},
author = {Huatong Song and Jinhao Jiang and Wenqing Tian and Zhipeng Chen and Yuhuan Wu and Jiahao Zhao and Yingqian Min and Wayne Xin Zhao and Lei Fang and Ji-Rong Wen},
journal= {arXiv preprint arXiv:2505.17005},
year = {2025}
}