中文

RAG-E:量化检索-生成器对齐与失效模式

计算与语言 2026-01-30 v1

摘要

检索增强生成(RAG)系统将稠密检索器与语言模型组合,以检索文档 grounding LLM 输出。然而,这些组件交互的不透明性在高风险领域部署中造成了挑战。我们提出 RAG-E,一个端到端可解释框架,通过数学方法论量化检索-生成器对齐。我们的方法为检索器分析适配集成梯度(Integrated Gradients),引入 PMCSHAP——一种蒙特卡罗稳定的Shapley 值近似,用于生成器归因,并引入加权归因-相关性间隙(WARG)指标,以衡量生成器的文档使用与检索器排序排名的对齐程度。在 TREC CAsT 和 FoodSafeSum 上的经验分析揭示了关键失效模式:对于 47.4% 到 66.7% 的查询,生成器忽略检索器的 top-ranked 文档,而 48.1% 到 65.9% 的查询依赖于被排名为不那么相关的文档。这些失效模式表明,RAG 输出质量不仅取决于单个组件的性能,还取决于它们的相互作用,这可以通过 RAG-E 进行审计。

关键词

引用

@article{arxiv.2601.21803,
  title  = {RAG-E: Quantifying Retriever-Generator Alignment and Failure Modes},
  author = {Korbinian Randl and Guido Rocchietti and Aron Henriksson and Ziawasch Abedjan and Tony Lindgren and John Pavlopoulos},
  journal= {arXiv preprint arXiv:2601.21803},
  year   = {2026}
}