中文

跨语言机器阅读理解

计算与语言 2019-11-05 v1 机器学习 神经与进化计算

摘要

尽管社区在机器阅读理解(MRC)任务上已取得巨大进展,但以往工作多致力于基于英语的 MRC 问题,由于大规模训练数据的匮乏,针对其他语言的研究甚少。本文提出面向非英语语言的跨语言机器阅读理解(CLMRC)任务。首先,我们给出若干直接可用的 CLMRC 回译方法。然而,将答案准确对齐至另一语言较为困难且会引入额外噪声。在此背景下,我们提出一种名为 Dual BERT 的新模型,其利用富资源语言(如英语)提供的大规模训练数据,在双语语境下学习篇章与问题间的语义关系,进而将所学知识用于提升低资源语言的阅读理解性能。我们在两个中文机器阅读理解数据集 CMRC 2018 与 DRCD 上开展实验。结果表明,相较各类 SOTA 系统取得了一致且显著的大幅度提升,彰显了 CLMRC 任务的潜力。资源见:https://github.com/ymcui/Cross-Lingual-MRC

关键词

引用

@article{arxiv.1909.00361,
  title  = {Cross-Lingual Machine Reading Comprehension},
  author = {Yiming Cui and Wanxiang Che and Ting Liu and Bing Qin and Shijin Wang and Guoping Hu},
  journal= {arXiv preprint arXiv:1909.00361},
  year   = {2019}
}

备注

10 pages, accepted as a conference paper at EMNLP-IJCNLP 2019 (long paper)