中文

LiveRAG:用于RAG评估的多样化Q&A数据集

计算与语言 2025-11-19 v1 信息检索

摘要

随着检索增强生成(RAG)在生成式AI解决方案中日益受到关注,亟需系统性地评估其有效性。我们引入LiveRAG基准数据集,这是一个包含895个合成问题与答案的数据集,旨在支持RAG基于Q&A系统的系统评估。该合成基准数据源自2025年SIGIR LiveRAG挑战期间使用的数据集,在严格的时间限制下进行评估。数据集增补了竞争者在挑战期间未公开的信息,包括真实答案及其关联支持性论断,这些论断用于评估竞争者答案。此外,每道问题都关联估算难度和可区分性分数,这些分数基于对竞争者响应应用项目反应理论模型(Item Response Theory)而得。我们的分析表明,LiveRAG基准数据的题目具有多样性,难度水平广泛,且在区分系统能力方面实用性突出。LiveRAG基准数据集希望能帮助社区推动RAG研究,开展系统评估,并开发更稳健的Q&A系统。

关键词

引用

@article{arxiv.2511.14531,
  title  = {LiveRAG: A diverse Q&A dataset with varying difficulty level for RAG evaluation},
  author = {David Carmel and Simone Filice and Guy Horowitz and Yoelle Maarek and Alex Shtoff and Oren Somekh and Ran Tavory},
  journal= {arXiv preprint arXiv:2511.14531},
  year   = {2025}
}

备注

14 pages, 4 figures, 5 tables