中文

RAG中检索器的相关性是否传递给生成器?

信息检索 2025-02-24 v1

摘要

检索增强生成(RAG)是一种将外部知识(通常以来自集合中检索到的文档集合的形式)作为大型语言模型(LLM)的提示的一部分,以 potentially improve下游任务性能(如问答)的框架。与标准检索任务的目标(最大化一组顶级文档的相关性)不同,RAG系统的目标是最大化其总体效用,其中文档的效用指示将其作为额外上下文信息包含在LLM提示中是否改进下游任务。现有研究探讨了RAG上下文相关性在知识密集型语言任务(KILT)中的作用,其中相关性本质上呈现为答案包含。在我们看来,相关性对应于查询与文档之间的主题重叠程度,用于信息寻求任务。具体而言,我们利用IR测试集合来实证研究,RAG上下文由主题相关文档组成,是否导致改进的下游性能。我们的实验得出以下发现:(a)相关性与效用之间存在较小的正相关性;(b)随着上下文大小的增加(k-shot值增加),该相关性减小;(c)更有效的检索模型通常导致更好的下游RAG性能。

关键词

引用

@article{arxiv.2502.15025,
  title  = {Is Relevance Propagated from Retriever to Generator in RAG?},
  author = {Fangzheng Tian and Debasis Ganguly and Craig Macdonald},
  journal= {arXiv preprint arXiv:2502.15025},
  year   = {2025}
}

备注

18 pages (including reference), 5 figures, 1 table, 48 references; this paper has been accepted by ECIR'25 as a full paper