基于句子抽取的越南语机器阅读理解
计算与语言
2021-06-14 v2
摘要
自然语言处理(NLP)尤其是机器阅读理解的发展已引起研究界的极大关注。近年来,出现了若干大规模的越南语机器阅读理解数据集,如 UIT-ViQuAD 与 UIT-ViNewsQA。然而,这些数据集的答案为研究所提供的多样性不足。本文我们介绍 UIT-ViWikiQA,首个用于评估越南语基于句子抽取的机器阅读理解的数据集。UIT-ViWikiQA 数据集由 UIT-ViQuAD 数据集转换而来,包含基于 174 篇越南语维基百科文章的 5,109 个段落生成的 23,074 个问答对。我们提出了一种用于构建基于句子抽取的机器阅读理解数据集的转换算法,以及三类越南语基于句子抽取的机器阅读理解方法。实验表明,最优机器模型为 XLM-R_Large,其在我们的数据集上取得了 85.97% 的精确匹配(EM)与 88.77% 的 F1 分数。此外,我们从越南语问题类型及上下文对 MRC 模型性能的影响两方面分析实验结果,从而展示我们所提 UIT-ViWikiQA 数据集给语言处理界带来的挑战。
引用
@article{arxiv.2105.09043,
title = {Sentence Extraction-Based Machine Reading Comprehension for Vietnamese},
author = {Phong Nguyen-Thuan Do and Nhat Duy Nguyen and Tin Van Huynh and Kiet Van Nguyen and Anh Gia-Tuan Nguyen and Ngan Luu-Thuy Nguyen},
journal= {arXiv preprint arXiv:2105.09043},
year = {2021}
}
备注
Accepted by KSEM 2021 (International Conference on Knowledge Science, Engineering and Management)