我们可以用合成数据评估RAG吗?
计算与语言
2025-10-22 v2 人工智能
摘要
我们探讨了由大型语言模型(LLM)生成的合成问答(QA)数据能否作为人工标注基准测试的有效代理,尤其是在后者不可得时。我们在两个实验中评估合成基准的可靠性:一个在保持生成器固定的同时变化检索器参数,另一个在固定检索器参数的同时变化生成器。我们发现,在四个数据集(其中两个为开放域,两个为专有数据)上,合成基准能够可靠地对检索器配置变化的RAG进行排序,与人工标注基准基准相当吻合。然而,它们在比较生成器架构时并不一致地产生可靠的RAG排序。这种分解可能源于合成基准与人工基准之间任务不匹配的因素,以及偏好特定生成器的风格偏差。
引用
@article{arxiv.2508.11758,
title = {Can we Evaluate RAGs with Synthetic Data?},
author = {Jonas van Elburg and Peter van der Putten and Maarten Marx},
journal= {arXiv preprint arXiv:2508.11758},
year = {2025}
}
备注
Accepted for the SynDAiTE workshop at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2025), September 15, 2025 - Porto, Portugal