长上下文语言模型检索增强生成的更强基线
计算与语言
2026-01-13 v2
摘要
随着能够处理数万 tokens 的长上下文语言模型(LMs)的兴起,多阶段检索增强生成(RAG)流水线相对于更简单的单阶段方法是否仍提供可衡量的优势?为了评估这个问题,我们在系统扩展的 token 预算下对 QA 任务进行了受控评估,比较了两个最近的多阶段流水线 ReadAgent 和 RAPTOR 与三个基线,包括 DOS RAG(Document's Original Structure RAG),一种保留原始段落顺序的简单检索-然后-阅读方法。尽管其设计简单,DOS RAG 在多个长上下文 QA 基准测试中始终匹配或优于更复杂的方法。我们将这一优势归因于保持源忠实性和文档结构、在有效上下文窗口内优先召回率以及偏好简单性而非增加的流水线复杂性。我们建议将 DOS RAG 建立为未来 RAG 评估的简单而强大的基线,搭配最先进的嵌入和语言模型,并在匹配的 token 预算下进行基准测试,以确保随着模型的持续改进,增加的流水线复杂性是由明确的性能提升来证明的。
引用
@article{arxiv.2506.03989,
title = {Stronger Baselines for Retrieval-Augmented Generation with Long-Context Language Models},
author = {Alex Laitenberger and Christopher D. Manning and Nelson F. Liu},
journal= {arXiv preprint arXiv:2506.03989},
year = {2026}
}
备注
11 pages, 6 figures, for associated source code, see https://github.com/alex-laitenberger/stronger-baselines-rag