WebFAQ:用于稠密检索的多语言自然问答数据集集合
计算与语言
2025-03-03 v1 人工智能
信息检索
摘要
我们提出了WebFAQ,这是一个大规模的开放域问答数据集集合,源自FAQ风格的schema.org标注。该数据集集合共包含跨75种语言的9600万个自然问答对,其中包含4700万个(49%)非英语样本。WebFAQ进一步作为20个单语检索基准的基础,总规模达1120万个问答对(590万个非英语)。这些数据集通过精细的过滤和近似重复检测进行了精心整理,为训练和评估多语言稠密检索模型提供了高质量资源。为了实证验证WebFAQ的有效性,我们使用收集到的问答数据对域内预训练的XLM-RoBERTa模型进行了微调。通过这种针对特定数据集的微调,该模型获得了显著的检索性能提升,并且在零样本设置下能够泛化到WebFAQ之外的其他多语言检索基准。最后,我们利用WebFAQ,使用最先进的双语语料挖掘和LLM辅助的自动翻译评估技术,构建了一组涵盖超过1000个语言对的问答对齐双语语料库。由于我们采用了先进的自动化双语数据集生成方法,与类似数据集相比,所生成的双语语料库展现出更高的翻译质量。WebFAQ及所有相关资源已在GitHub和HuggingFace上公开发布。
引用
@article{arxiv.2502.20936,
title = {WebFAQ: A Multilingual Collection of Natural Q&A Datasets for Dense Retrieval},
author = {Michael Dinzinger and Laura Caspari and Kanishka Ghosh Dastidar and Jelena Mitrović and Michael Granitzer},
journal= {arXiv preprint arXiv:2502.20936},
year = {2025}
}
备注
10 pages, 3 figures, 7 tables