当迭代 RAG 胜过理想证据:科学多跳问答中的诊断研究
计算与语言
2026-05-05 v3 人工智能
信息检索
摘要
检索增强生成(RAG)将大型语言模型(LLM)扩展至参数化知识之外,但目前尚不清楚迭代检索-推理循环何时能显著优于静态 RAG,尤其是在需要多跳推理、领域知识稀疏且证据异质的科学领域。我们提供了首个受控的、机制层面的诊断研究,以探究同步的迭代检索与推理是否能超越理想化的静态上界(Gold Context)RAG。我们在三种机制下对十一个最先进的 LLM 进行了基准测试:(i)无上下文,衡量对参数化记忆的依赖;(ii)Gold Context,一次性提供所有预言机证据;(iii)迭代 RAG,一个无需训练的控制器,交替进行检索、假设精炼和证据感知停止。使用聚焦化学的 ChemKGMultiHopQA 数据集,我们分离出需要真正检索的问题,并利用涵盖检索覆盖缺口、锚点-载体丢失、查询质量、组合保真度和控制校准的诊断方法分析其行为。在所有模型中,迭代 RAG 始终优于 Gold Context,增益最高达 25.6 个百分点,尤其是对于非推理微调模型。分阶段检索减少了后期跳数的失败,缓解了上下文过载,并能够动态纠正早期假设漂移,但剩余的失败模式包括跳数覆盖不全、干扰物锁定轨迹、提前停止校准失误,以及即使在完美检索下仍存在的高组合失败率。总体而言,分阶段检索往往比仅仅存在理想证据更具影响力;我们为在专业科学环境中部署和诊断 RAG 系统提供了实用指导,并为更可靠、可控的迭代检索-推理框架奠定了基础。
引用
@article{arxiv.2601.19827,
title = {When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering},
author = {Mahdi Astaraki and Mohammad Arshi Saloot and Ali Shiraee Kasmaee and Hamidreza Mahyar and Soheila Samiee},
journal= {arXiv preprint arXiv:2601.19827},
year = {2026}
}
备注
27 pages, 15 figures