中文

从充分性到反思:基于强化学习的检索增强推理中的思考质量

计算与语言 2025-08-07 v2

摘要

基于强化学习的检索增强生成 (RAG) 方法提高了大型语言模型 (LLM) 的推理能力。然而,大多数方法仅依赖最终答案的奖励,忽略了中间推理质量。本文分析了现有的 RAG 推理模型,识别出三种主要失败模式:(1) 信息不足,即模型未检索到足够的支持;(2) 推理错误,即使信息充足,仍出现逻辑或内容层面的缺陷;(3) 答案与推理不一致,即使存在有效的推理链,仍导致最终答案与之不匹配。我们提出了 TIRESRAG-R1,一种新型框架采用思考-检索-反思过程和多维奖励系统以提高推理质量和稳定性。TIRESRAG-R1 引入:(1) 充分性奖励以鼓励彻底检索;(2) 推理质量奖励以评估推理链的合理性和准确性;(3) 反思奖励以检测并修正错误。还采用难度感知加权策略和训练样本筛选以提升复杂任务上的性能。在四个多跳问答数据集上的实验表明,TIRESRAG-R1 优于先前的 RAG 方法,并在单跳任务上表现出良好的泛化能力。代码和数据已公开:https://github.com/probe2/TIRESRAG-R1。

关键词

引用

@article{arxiv.2507.22716,
  title  = {From Sufficiency to Reflection: Reinforcement-Guided Thinking Quality in Retrieval-Augmented Reasoning for LLMs},
  author = {Jie He and Victor Gutiérrez-Basulto and Jeff Z. Pan},
  journal= {arXiv preprint arXiv:2507.22716},
  year   = {2025}
}