FQuAD:法语问答数据集
计算与语言
2020-05-26 v2 人工智能
机器学习
摘要
语言建模领域的近期进展改进了许多自然语言处理任务的当前最优结果。其中,阅读理解在过去几年取得了显著进展。然而,由于英语以外的语言(如法语)可用标注资源仍然稀缺,多数结果以英语报道。在本文工作中,我们引入了法语问答数据集(FQuAD)。FQuAD 是一个法语原生的阅读理解数据集,包含基于一组维基百科文章的问题与答案,1.0 版本包含 25,000+ 样本,1.1 版本包含 60,000+ 样本。我们训练了一个基线模型,在测试集上取得了 92.2 的 F1 分数和 82.1 的精确匹配率。为追踪法语问答模型的进展,我们提出了一个排行榜,并已将我们数据集的 1.0 版本免费发布于 https://illuin-tech.github.io/FQuAD-explorer/。
引用
@article{arxiv.2002.06071,
title = {FQuAD: French Question Answering Dataset},
author = {Martin d'Hoffschmidt and Wacim Belblidia and Tom Brendlé and Quentin Heinrich and Maxime Vidal},
journal= {arXiv preprint arXiv:2002.06071},
year = {2020}
}
备注
15 pages, 5 figures