NorQuAD:挪威语问答数据集
计算与语言
2023-05-04 v1
摘要
在本文中,我们提出 NorQuAD:首个用于机器阅读理解(machine reading comprehension)的挪威语问答数据集。该数据集由 4,752 个手动创建的问题-答案对组成。我们在此详述数据收集过程并给出数据集的统计数据。我们还在该数据集上对若干多语言及挪威语单语语言模型进行了基准测试,并将它们与人类表现进行比较。该数据集将免费公开。
引用
@article{arxiv.2305.01957,
title = {NorQuAD: Norwegian Question Answering Dataset},
author = {Sardana Ivanova and Fredrik Aas Andreassen and Matias Jentoft and Sondre Wold and Lilja Øvrelid},
journal= {arXiv preprint arXiv:2305.01957},
year = {2023}
}
备注
Accepted to NoDaLiDa 2023