LaRA:基准测试检索增强生成与长上下文大语言模型——没有 LC 或 RAG 的银弹用于路由
计算与语言
2025-03-06 v2 人工智能
摘要
有效地将外部知识整合到大语言模型(LLM)中至关重要,以增强其能力并满足实际需求。检索增强生成(RAG)通过检索最相关的片段到LLM中来实现这一目标。然而,LLM上下文窗口大小的进步提供了一种替代方法,引发了一个问题:RAG是否仍然是有效处理外部知识的必要手段?已有的几项研究提供的RAG和长上下文(LC)LLM之间的比较结论不明确,主要由于基准测试设计的局限性。在本 paper 中,我们提出了LaRA,一个专为严格比较RAG和LC LLM而设计的新型基准测试。LaRA涵盖2326个测试案例,涉及四个实际 QA 任务类别和三种自然发生的长文本类型。通过系统评估七个开源和四个专有LLM,我们发现RAG和LC之间的最佳选择取决于多个因素的复杂相互作用,包括模型的参数规模、长文本功能、上下文长度、任务类型以及检索块的特征。我们的发现为实践者提供了可操作的指南,以有效地利用RAG和LC方法来开发和部署LLM应用程序。我们的 code 和数据集提供于:\href{https://github.com/Alibaba-NLP/LaRA}{\textbf{https://github.com/Alibaba-NLP/LaRA}}。
引用
@article{arxiv.2502.09977,
title = {LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs -- No Silver Bullet for LC or RAG Routing},
author = {Kuan Li and Liwen Zhang and Yong Jiang and Pengjun Xie and Fei Huang and Shuai Wang and Minhao Cheng},
journal= {arXiv preprint arXiv:2502.09977},
year = {2025}
}
备注
22 pages