DataMorgana:用于生成多样Q&A基准的RAG评估工具
统计方法学
2025-01-23 v1
摘要
评估检索增强生成(RAG)系统,特别是在特定领域情境下,需要满足 applicative 场景独特要求的基准。由于获取真实数据困难,常见策略是使用基于大语言模型的方法生成合成数据。现有解决方案通用为给定文档生成问题以构建Q&A对。然而,尽管生成的问题在个体上可能很好,但通常不够多样化,以充分覆盖真实最终用户与RAG系统交互的不同方式。我们在此介绍 DataMorgana,一种为RAG应用生成高度可定制且多样化的合成Q&A基准的工具。DataMorgana 允许对用户和问题类别进行详细配置,并提供对其在基准中分布的控制。它采用轻量级两阶段过程,确保高效和快速迭代,同时生成反映预期流量的基准。我们进行了详尽的实验,定量和定性地表明 DataMorgana 在跨领域特定和通用知识语料库中,在产生词汇、语法和语义多样化问题集方面超越现有工具和方法。DataMorgana 将在研究社区中提供给所选团队作为首批 beta 测试者,计划于2025年2月初公布的 SIGIR'2025 LiveRAG 挑战赛中进行测试。
引用
@article{arxiv.2501.12787,
title = {Flexible tree-structured regression for clustered data with an application to quality of life in older adults},
author = {Nikolai Spuck and Matthias Schmid and Moritz Berger},
journal= {arXiv preprint arXiv:2501.12787},
year = {2025}
}