用于评估机器阅读理解能力的越南语数据集
计算与语言
2020-11-10 v3
摘要
全球有超过9700万人以越南语为母语。然而,针对越南语的机器阅读理解(MRC,即理解文本并回答相关问题)的研究甚少。由于缺乏越南语基准数据集,我们提出了越南语问答数据集(UIT-ViQuAD),这是一个面向越南语等低资源语言、用于评估MRC模型的新数据集。该数据集基于维基百科174篇越南语文章的5109个段落,包含超过23000个人工生成的问答对。特别地,我们提出了一种面向越南语MRC的数据集构建新流程。我们的深入分析表明,该数据集所需能力超出简单的词匹配推理,而要求进行单句与多句推理。此外,我们以当前最先进的英语与中文MRC方法作为UIT-ViQuAD上的首批实验模型开展实验。我们还估算了人类在该数据集上的表现,并与强大机器学习模型的实验结果进行比较。结果显示,人类表现与数据集上最佳模型表现之间的显著差距表明,未来研究可在UIT-ViQuAD上取得改进。我们的数据集已在网站上免费开放,以鼓励研究界攻克越南语MRC中的挑战。
引用
@article{arxiv.2009.14725,
title = {A Vietnamese Dataset for Evaluating Machine Reading Comprehension},
author = {Kiet Van Nguyen and Duc-Vu Nguyen and Anh Gia-Tuan Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2009.14725},
year = {2020}
}
备注
Accepted by The 28th International Conference on Computational Linguistics (COLING 2020)