跨语言机器阅读理解
计算与语言
2019-11-05 v1 机器学习
神经与进化计算
摘要
尽管社区在机器阅读理解(MRC)任务上已取得巨大进展,但以往工作多致力于基于英语的 MRC 问题,由于大规模训练数据的匮乏,针对其他语言的研究甚少。本文提出面向非英语语言的跨语言机器阅读理解(CLMRC)任务。首先,我们给出若干直接可用的 CLMRC 回译方法。然而,将答案准确对齐至另一语言较为困难且会引入额外噪声。在此背景下,我们提出一种名为 Dual BERT 的新模型,其利用富资源语言(如英语)提供的大规模训练数据,在双语语境下学习篇章与问题间的语义关系,进而将所学知识用于提升低资源语言的阅读理解性能。我们在两个中文机器阅读理解数据集 CMRC 2018 与 DRCD 上开展实验。结果表明,相较各类 SOTA 系统取得了一致且显著的大幅度提升,彰显了 CLMRC 任务的潜力。资源见:https://github.com/ymcui/Cross-Lingual-MRC
引用
@article{arxiv.1909.00361,
title = {Cross-Lingual Machine Reading Comprehension},
author = {Yiming Cui and Wanxiang Che and Ting Liu and Bing Qin and Shijin Wang and Guoping Hu},
journal= {arXiv preprint arXiv:1909.00361},
year = {2019}
}
备注
10 pages, accepted as a conference paper at EMNLP-IJCNLP 2019 (long paper)