面向企业检索增强生成的 WixQA:一个多数据集基准
人工智能
2025-05-14 v1 机器学习
摘要
检索增强生成(RAG)是现代问答系统的基石,使其能够基于外部知识生成可靠答案。虽然近期进展由开放域数据集推动,但企业问答系统需要的数据集需镜像用户在日常支持场景中提出的具体、领域特定问题。关键在于,评估端到端 RAG 系统需要的数据集不仅包含问答对,还需包含答案所来源的具体知识库(KB)快照。为此,我们引入 WixQA,一个基准套件,包含精确基于公开 KB 语料构建的 QA 数据集,实现对检索和生成组件的整体评估。WixQA 包括三个不同的 QA 数据集,源自 Wix.com 客户支持交互,基于公开 Wix 帮助中心 KB 的快照构建:(i)WixQA-ExpertWritten,200 条真实用户查询及其专家撰写的多步骤答案;(ii)WixQA-Simulated,200 条经专家验证的 QA 对,摘自用户对话;(iii)WixQA-Synthetic,6222 条由大语言模型生成的 QA 对,每个知识库文章均生成一条 QA 对。我们随 KB 快照一起发布数据集,采用 MIT 许可证,并提供全面的基线结果,形成独特的企业 RAG 系统在真实企业环境中评估的基准。
引用
@article{arxiv.2505.08643,
title = {WixQA: A Multi-Dataset Benchmark for Enterprise Retrieval-Augmented Generation},
author = {Dvir Cohen and Lin Burg and Sviatoslav Pykhnivskyi and Hagit Gur and Stanislav Kovynov and Olga Atzmon and Gilad Barkan},
journal= {arXiv preprint arXiv:2505.08643},
year = {2025}
}