中文

利用外部知识增强基于词汇的方法用于越南语多选机器阅读理解

计算与语言 2020-11-03 v5

摘要

尽管越南语是全球第 17 大母语使用者的语言,但关于越南语机器阅读理解(MRC,即理解文本并回答相关问题的任务)的研究并不多。原因之一在于缺乏用于该任务的高质量基准数据集。在本工作中,我们构建了一个包含 2783 对多选问答的数据集,这些问答基于 417 篇常用于小学生阅读理解教学的越南语文本。此外,我们提出了一种基于词汇的 MRC 方法,该方法利用语义相似度度量和外部知识源来分析问题并从给定文本中抽取答案。我们将所提模型与若干基于词汇和基于神经网络的基线模型进行了性能比较。我们提出的方法在准确率上达到 61.81%,比最佳基线模型高出 5.51%。我们还测量了人类在我们数据集上的表现,发现机器模型与人类表现之间存在较大差距。这表明该任务仍有显著进步空间。该数据集可免费在我们的网站上获取以供研究使用。

关键词

引用

@article{arxiv.2001.05687,
  title  = {Enhancing lexical-based approach with external knowledge for Vietnamese multiple-choice machine reading comprehension},
  author = {Kiet Van Nguyen and Khiem Vinh Tran and Son T. Luu and Anh Gia-Tuan Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2001.05687},
  year   = {2020}
}