GaRAGe:带 grounding 注释的 RAG 基准测试
计算与语言
2025-06-10 v1 人工智能
摘要
我们提出 GaRAGe,一个大型 RAG 基准测试,包含人工精选的长形式答案和每段 grounding 信息的注释,允许对 LLMs 生成 RAG 回答时是否识别相关 grounding 进行细粒度评估。该基准测试包含 2366 个问题,涵盖多样化的复杂性、动态性和主题,并包含超过 35K 条来自私有文档集和 Web 的已注释 passage,以反映真实世界的 RAG 用例。这使得其成为评估 LLM 识别仅相关信息以组成性别响应能力或在缺乏相关 grounding 时提供迂回响应的理想测试平台。对多个最新 SOTA LLMs 在 GaRAGe 上的评估显示,这些模型倾向于过度概括,而不是(a)严格基于已注释的相关 passage grounding 其答案(最高至 60% 的 Relevance-Aware Factuality Score),或(b)在无相关 grounding 时迂回(在迂回方面最高仅达 31% 的 true positive rate)。对相关来源的归因 F1 最高仅为 58.9%,我们还展示了在回答时敏感问题以及依赖稀疏私有 grounding 来源时表现显著下降。
引用
@article{arxiv.2506.07671,
title = {GaRAGe: A Benchmark with Grounding Annotations for RAG Evaluation},
author = {Ionut-Teodor Sorodoc and Leonardo F. R. Ribeiro and Rexhina Blloshmi and Christopher Davis and Adrià de Gispert},
journal= {arXiv preprint arXiv:2506.07671},
year = {2025}
}
备注
ACL 2025 (Findings)