LLM可否为评估RAG系统提供可靠评估?——方法与数据集的调查综述
信息检索
2025-08-08 v2 人工智能
摘要
检索增强生成(RAG)近年来取得了显著进展。RAG系统的复杂性——涉及索引、检索和生成等多个组件,以及诸多其他参数——为系统atic evaluation和质量提升构成了重大挑战。先前研究表明,评估RAG系统对于记录进展、比较配置和识别特定领域应用的有效方法至关重要。本研究系统性地审阅了63篇学术文章,提供RAG评估方法的全面概览, focus on四个关键领域:数据集、检索器、索引和数据库,以及生成器组件。我们观察到,针对RAG系统每个组件都可采用自动化评估方法,利用能够生成评估数据集并执行评估的LLM。此外,我们发现,为企业提供清晰的实施和评估RAG系统的``做''与``不做''指导方针的进一步实践研究至关重要。通过综合RAG关键组件的评估方法,并强调为基准测试创建和适配特定领域数据集的重要性,我们为RAG系统的系统评估方法的进步以及评估严谨性的提升做出了贡献。此外,通过审查利用LLM实现自动化方法与人类判断之间的相互作用,我们为在实现稳健可靠评估方面平衡自动化与人类输入的论争做出了贡献,阐明了它们各自的贡献、局限性和挑战。
引用
@article{arxiv.2504.20119,
title = {Can LLMs Be Trusted for Evaluating RAG Systems? A Survey of Methods and Datasets},
author = {Lorenz Brehme and Thomas Ströhle and Ruth Breu},
journal= {arXiv preprint arXiv:2504.20119},
year = {2025}
}
备注
8 Pages. This paper has been accepted for presentation at the IEEE Swiss Conference on Data Science (SDS25)