基于 BERT 的英语与印地语多语言机器阅读理解
计算与语言
2020-06-03 v1
摘要
多语言机器阅读理解(MMC)是问答(QA)的一个子任务,涉及从给定文本片段中引用问题的答案,其中问题和片段可以处于不同的语言中。最近发布的 BERT 的多语言变体(m-BERT),使用 104 种语言进行预训练,在多语言任务的零样本和微调设置中均表现良好;然而,它尚未用于英语-印地语 MMC。因此,在本文中,我们展示了在零样本、单语言(例如印地语问题-印地语片段)和跨语言(例如英语问题-印地语片段)微调设置下使用 m-BERT 进行 MMC 的实验。这些模型变体在所有可能的多语言设置下进行了评估,并将结果与这些语言当前 SOTA 的序列 QA 系统进行了比较。实验表明,经过微调的 m-BERT 在先前模型使用的两个数据集的所有评估设置上均提高了性能,从而确立了基于 m-BERT 的 MMC 作为英语和印地语的新 SOTA。我们还在最近发布的 XQuAD 数据集的扩展版本上发布了我们的结果,我们建议将其作为未来研究的评估基准。
引用
@article{arxiv.2006.01432,
title = {BERT Based Multilingual Machine Comprehension in English and Hindi},
author = {Somil Gupta and Nilesh Khade},
journal= {arXiv preprint arXiv:2006.01432},
year = {2020}
}
备注
Submitted for review to the Special Issue on Deep Learning of ACM Transactions on Asian and Low-Resource Language Information Processing (TALLIP)