GlobalRAG:通过强化学习提升多跳问答中全局推理能力
计算与语言
2026-03-17 v4 人工智能
摘要
近期,强化学习在改进检索增强生成(RAG)方面展现出前景。尽管如此,其在多跳问答(QA)中的有效性仍受到两个根本性限制的制约:(i)缺乏全局规划以构建多步骤推理结构,(ii)执行结果不可靠,阻碍了有效的查询构建和一致的检索证据使用。我们提出GlobalRAG,一个旨在提升多跳问答中全局推理的强化学习框架。GlobalRAG将问题分解为子目标,协调检索与推理,并迭代细化证据。为引导此过程,我们引入规划质量奖励和子目标完成奖励,以鼓励连贯的规划和可靠的子目标执行。此外,采用渐进权重退火策略平衡过程导向目标与结果导向目标。大量实验表明,在域内和域外基准测试中,GlobalRAG显著优于强基线,且仅需8k训练数据(强基线使用的训练数据的42%),在EM和F1指数上平均提升14.2%。
引用
@article{arxiv.2510.20548,
title = {GlobalRAG: Enhancing Global Reasoning in Multi-hop Question Answering via Reinforcement Learning},
author = {Jinchang Luo and Mingquan Cheng and Fan Wan and Ni Li and Xiaoling Xia and Shuangshuang Tian and Tingcheng Bian and Haiwei Wang and Haohuan Fu and Yan Tao},
journal= {arXiv preprint arXiv:2510.20548},
year = {2026}
}
备注
8 pages, 3 figures, 4 tables