大语言模型时代的检索增强生成评估:全面综述
计算与语言
2025-04-22 v1
摘要
近期检索增强生成(RAG)技术的进展正在通过将大型语言模型(LLMs)与外部信息检索集成,实现对自然语言处理中各种应用的准确、最新和可验证的文本生成,从而实现变革性的突破。然而,由于其混合体系结构结合了检索和生成组件,以及其对 LLM 时代动态知识源的依赖,评估 RAG 系统 presents 独特的挑战。在此背景下,本文提供了 RAG 评估方法和框架的全面概述,系统性地审阅了传统方法和新兴评估方法,涵盖 LLM 时代下系统性能、事实准确性、安全性和计算效率。我们还编译并分类了 RAG 特定数据集和评估框架,对高影响力 RAG 研究中的评估实践进行了元分析。迄今为止,本工作代表了 RAG 评估领域最全面的调查,搭建了传统方法与 LLM 驱动方法之间的桥梁,为推动 RAG 开发提供了关键资源。
引用
@article{arxiv.2504.14891,
title = {Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey},
author = {Aoran Gan and Hao Yu and Kai Zhang and Qi Liu and Wenyu Yan and Zhenya Huang and Shiwei Tong and Guoping Hu},
journal= {arXiv preprint arXiv:2504.14891},
year = {2025}
}
备注
18 pages, 5 figures