噪声的力量:重新定义RAG系统的检索
信息检索
2024-05-02 v4 计算与语言
摘要
检索增强生成(Retrieval-Augmented Generation, RAG)作为一种方法,通过用信息检索(Information Retrieval, IR)系统检索到的相关段落或文档来增强原始提示,从而扩展大型语言模型(Large Language Models)的预训练知识,近来已崭露头角。RAG对于生成式AI解决方案变得日益重要,尤其是在企业环境或任何知识不断更新且无法被LLM记忆的领域中。我们在此主张,RAG系统的检索组件,无论是稠密还是稀疏的,都值得研究界给予更多关注,因此,我们对RAG系统的检索策略进行了首次全面且系统的审视。我们特别关注RAG解决方案中IR系统应检索的段落类型。我们的分析考虑了多个因素,例如提示上下文中包含的段落的相关性、它们的位置以及它们的数量。本项工作一个反直觉的发现是,检索器给出的与查询不直接相关(例如,不包含答案)的最高分文档会对LLM的有效性产生负面影响。更令人惊讶的是,我们发现,在提示中加入随机文档可将LLM的准确率提高多达35%。这些结果凸显了在将检索与LLM集成时研究恰当策略的必要性,从而为该领域的未来研究奠定了基础。
引用
@article{arxiv.2401.14887,
title = {The Power of Noise: Redefining Retrieval for RAG Systems},
author = {Florin Cuconasu and Giovanni Trappolini and Federico Siciliano and Simone Filice and Cesare Campagnano and Yoelle Maarek and Nicola Tonellotto and Fabrizio Silvestri},
journal= {arXiv preprint arXiv:2401.14887},
year = {2024}
}