中文

面向RAG评估的众包可行性研究

信息检索 2025-04-23 v1

摘要

人类在检索增强生成(RAG)情境下的写作和判断能力如何?为回答此问题,我们通过两个互补研究来探讨众包在RAG中的有效性:响应写作和响应实用性判断。我们提出了Crowd RAG Corpus 2025(CrowdRAG-25),其中包含903个人类撰写的响应和903个由LLM生成的响应,覆盖TREC RAG'24轨道的301个主题,分为'项目列表'、'散文'和'新闻'三种话语风格。对于65个主题,语料库进一步包含47,320个两两人类判断和10,556个两两LLM判断,涵盖七个实用性维度(如覆盖性和连贯性)。我们的分析提供了关于RAG人类写作行为以及众包在RAG评估中可行性的见解。人类两两判断相较于LLM-based两两判断或人类/LLM-based点评判断以及与人类撰写参考响应的自动比较,提供了可靠且高性价比的结果。我们的所有数据和工具均 freely available。

关键词

引用

@article{arxiv.2504.15689,
  title  = {The Viability of Crowdsourcing for RAG Evaluation},
  author = {Lukas Gienapp and Tim Hagen and Maik Fröbe and Matthias Hagen and Benno Stein and Martin Potthast and Harrisen Scells},
  journal= {arXiv preprint arXiv:2504.15689},
  year   = {2025}
}

备注

11 pages, 9 tables, 5 figures. Accepted at SIGIR'25