中文

DataMorgana:用于RAG评估生成多样化Q&A基准

计算与语言 2025-01-23 v1 信息检索

摘要

评估检索增强生成(RAG)系统,特别是在特定领域情境下,需要满足 applicative 场景独特要求的基准。由于获取真实数据困难,常见策略是使用基于大语言模型的方法生成合成数据。现有解决方案通用为给定文档生成问题以构建Q&A对。然而,尽管生成的问题在个体上可能很好,但通常不够多样化,以充分覆盖真实最终用户与RAG系统交互的不同方式。我们在此介绍 DataMorgana,一种为RAG应用生成高度可定制且多样化的合成Q&A基准的工具。DataMorgana 允许对用户和问题类别进行详细配置,并提供对其在基准中分布的控制。它采用轻量级两阶段过程,确保高效和快速迭代,同时生成反映预期流量的基准。我们进行了详尽的实验,定量和定性地表明 DataMorgana 在跨领域特定和通用知识语料库中, 在产生词汇、语法和语义多样化问题集方面超越现有工具和方法。DataMorgana 将在研究社区中提供给所选团队作为首批 beta 测试者,计划于2025年2月初公布的 SIGIR'2025 LiveRAG 挑战赛中进行测试。

关键词

引用

@article{arxiv.2501.12789,
  title  = {Generating Diverse Q&A Benchmarks for RAG Evaluation with DataMorgana},
  author = {Simone Filice and Guy Horowitz and David Carmel and Zohar Karnin and Liane Lewin-Eytan and Yoelle Maarek},
  journal= {arXiv preprint arXiv:2501.12789},
  year   = {2025}
}