中文

GlobalRAG:通过强化学习提升多跳问答中全局推理能力

计算与语言 2026-03-17 v4 人工智能

摘要

近期,强化学习在改进检索增强生成(RAG)方面展现出前景。尽管如此,其在多跳问答(QA)中的有效性仍受到两个根本性限制的制约:(i)缺乏全局规划以构建多步骤推理结构,(ii)执行结果不可靠,阻碍了有效的查询构建和一致的检索证据使用。我们提出GlobalRAG,一个旨在提升多跳问答中全局推理的强化学习框架。GlobalRAG将问题分解为子目标,协调检索与推理,并迭代细化证据。为引导此过程,我们引入规划质量奖励和子目标完成奖励,以鼓励连贯的规划和可靠的子目标执行。此外,采用渐进权重退火策略平衡过程导向目标与结果导向目标。大量实验表明,在域内和域外基准测试中,GlobalRAG显著优于强基线,且仅需8k训练数据(强基线使用的训练数据的42%),在EM和F1指数上平均提升14.2%。

关键词

引用

@article{arxiv.2510.20548,
  title  = {GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning},
  author = {Jinchang Luo and Mingquan Cheng and Fan Wan and Ni Li and Xiaoling Xia and Shuangshuang Tian and Tingcheng Bian and Haiwei Wang and Haohuan Fu and Yan Tao},
  journal= {arXiv preprint arXiv:2510.20548},
  year   = {2026}
}

备注

8 pages, 3 figures, 4 tables