信息丢失?重现 RAG 中文档位置与上下文规模效应
信息检索
2026-05-28 v2
摘要
检索增强生成 (RAG) 系统依赖将检索到的文档拼接到模型输入上下文中,因此文档排序和上下文规模成为关键且存在争议的设计选择。先前的研究报告了基于位置的效应,如“信息丢失于中间”及相关长上下文现象。然而,跨模型、数据集和评估协议的实证发现仍不一致且难以复现。本文提出一项系统化的可复现性研究,在受控评估框架下重审这些主张,并考察它们在当代大语言模型中的演变。我们首先表明,主题抽样是主要的方差来源: 小规模主题集合可能掩盖或放大排序效应。基于在多个主题预算下的重复子集抽样,我们提供了一套实用方法,以识别在可行成本下可获得稳定趋势的主题数量。使用这些固定主题集合,我们随后复现并扩展了文档位置敏感性的结果,重新评估“信息丢失于中间”及现代大语言模型中的位置偏差。随后,我们还研究了更现实的 RAG 场景,其中相关性由检索器而非对真实文档的 oracle 访问来决定。在此 setting 下,我们重新审视了最近的行业研究,并识别出评估选择(如有限主题覆盖和依赖基于 LLM 的评判器)导致的差异。最后,我们分析检索顺序和上下文规模如何影响 imperfect 检索下的数据集生成模型性能。我们的结果表明,这两个因素与检索质量和模型选择强烈交互,且从理想化设置中得出的结论不一定总是传递到真实世界的 RAG 流水线。我们发布所有代码和配置,以支持可复现性以及健壮 RAG 评估的未来工作。
引用
@article{arxiv.2605.27105,
title = {Lost in the Evidence? Reproducing Document Position and Context Size Effects in RAG},
author = {Jorge Gabín and Anxo Perez and Javier Parapar},
journal= {arXiv preprint arXiv:2605.27105},
year = {2026}
}
备注
Accepted at SIGIR 2026: 49th International ACM SIGIR Conference on Research and Development in Information Retrieval