中文

节约型RAG:在多跳问答中RL微调中的“少即是多”

计算与语言 2026-03-03 v3

摘要

基于最终答案奖励的强化学习 (RL) 已推动小型语言模型 (SLM) 在数学和代码等推理密集型任务上的近期进展。然而,将相同技术应用于检索增强生成 (RAG) 基准如多跳问答,往往仅取得有限的提升,常常落后于监督或仅依赖提示的基准。我们认为,RL 在多跳问答中的可行路径在于谨慎地利用测试时扩展,以优化最终答案的准确性和达成该答案的效率。我们提出了 FrugalRAG,一个两阶段微调框架,根据问题难度自适应减少检索步骤。首先,我们在覆盖全面探索策略(生成广泛子查询)的监督微调下训练 SLM。随后,我们应用 RL 根据问题难度自适应修剪搜索深度,直接奖励在正确性和节约性之间取得平衡的策略。与需 10 倍数据量的先前方法不同,我们的方法仅需约 1,000 个示例即可实现竞争性能。在 HotPotQA 和其他多跳问答基准上,FrugalRAG 实现了效率-准确性权衡的状态最佳水平,将检索成本几乎减半。此外,在具有挑战性的 BrowseCompPlus 数据集上,它实现了零-shot 推理并超越了 SLM 基准和其他基准。这些结果表明,RL 不是通过增加推理步骤来实现,而是通过减少步骤来有效解决可扩展且高效的 RAG。

关键词

引用

@article{arxiv.2507.07634,
  title  = {FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering},
  author = {Abhinav Java and Srivathsan Koundinyan and Nagarajan Natarajan and Amit Sharma},
  journal= {arXiv preprint arXiv:2507.07634},
  year   = {2026}
}