中文

我们可以用合成数据评估RAG吗?

计算与语言 2025-10-22 v2 人工智能

摘要

我们探讨了由大型语言模型(LLM)生成的合成问答(QA)数据能否作为人工标注基准测试的有效代理,尤其是在后者不可得时。我们在两个实验中评估合成基准的可靠性:一个在保持生成器固定的同时变化检索器参数,另一个在固定检索器参数的同时变化生成器。我们发现,在四个数据集(其中两个为开放域,两个为专有数据)上,合成基准能够可靠地对检索器配置变化的RAG进行排序,与人工标注基准基准相当吻合。然而,它们在比较生成器架构时并不一致地产生可靠的RAG排序。这种分解可能源于合成基准与人工基准之间任务不匹配的因素,以及偏好特定生成器的风格偏差。

关键词

引用

@article{arxiv.2508.11758,
  title  = {Can we Evaluate RAGs with Synthetic Data?},
  author = {Jonas van Elburg and Peter van der Putten and Maarten Marx},
  journal= {arXiv preprint arXiv:2508.11758},
  year   = {2025}
}

备注

Accepted for the SynDAiTE workshop at the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2025), September 15, 2025 - Porto, Portugal