MFAQ:一个多语言常见问题解答数据集
计算与语言
2021-10-06 v2
摘要
本文提出了首个公开可用的多语言常见问题解答(FAQ)数据集。我们从网络上收集了约600万对FAQ,涵盖21种不同语言。尽管该数据集规模远超现有FAQ检索数据集,但它也面临自身挑战:内容重复和主题分布不均。我们采用与密集段落检索(DPR)相似的设置,并在此数据集上测试了多种双编码器。实验表明,基于XLM-RoBERTa的多语言模型取得了最佳结果,英语除外。低资源语言似乎能从彼此中学习,因为多语言模型比特定语言模型获得了更高的平均倒数排名(MRR)。我们的定性分析揭示了模型在简单词语变化上的脆弱性。我们公开发布了我们的数据集、模型和训练脚本。
引用
@article{arxiv.2109.12870,
title = {MFAQ: a Multilingual FAQ Dataset},
author = {Maxime De Bruyn and Ehsan Lotfi and Jeska Buhmann and Walter Daelemans},
journal= {arXiv preprint arXiv:2109.12870},
year = {2021}
}
备注
Accepted at MRQA workshop (EMNLP 2021)