中文

ViMMRC 2.0——增强越南语文献文本的机器阅读理解

计算与语言 2025-07-21 v3

摘要

机器阅读理解近年来已成为一项有趣且富有挑战的任务,旨在从文本中提取有用信息。为使计算机具备理解阅读文本并回答相关信息的能力,我们引入了 ViMMRC 2.0——此前 ViMMRC 的扩展版,用于越南语教材中多选题阅读理解任务,这些教材包含面向一年级至十二年级学生的阅读文章。该数据集拥有 699 篇散文与诗歌阅读篇章,以及 5,273 个问题。新数据集中的问题不再像前一版本那样固定为四个选项。此外,问题难度有所提升,对模型寻找正确答案形成挑战。计算机必须理解阅读篇章的整体语境、问题以及各选项内容,以提取正确回答。为此,我们提出一种多阶段方法,将多步注意力网络(MAN)与自然语言推理(NLI)任务相结合,以提升阅读理解模型的性能。随后,我们在新数据集与 ViMMRC 1.0 上将所提方法与基线 BERTology 模型进行比较。由错误分析结果可见,阅读理解模型的挑战在于理解文本中的隐含语境并将其关联以找出正确答案。最后,我们希望新数据集能激励进一步研究,提升计算机理解越南语的能力。

关键词

引用

@article{arxiv.2303.18162,
  title  = {ViMMRC 2.0 -- Enhancing Machine Reading Comprehension on Vietnamese Literature Text},
  author = {Son T. Luu and Khoi Trong Hoang and Tuong Quang Pham and Kiet Van Nguyen and Ngan Luu-Thuy Nguyen},
  journal= {arXiv preprint arXiv:2303.18162},
  year   = {2025}
}

备注

Accepted for publication at International Journal of Asian Language Processing