中文

超越仅英语阅读理解:保加利亚语零样本多语言迁移的实验

计算与语言 2019-09-09 v2 信息检索

摘要

近来,阅读理解模型在SQuAD、CoQA、MS Macro、RACE等大规模数据集上取得了近人类表现。这主要得益于BERT和ELMo等预训练上下文表示的发布,其可针对目标任务微调。尽管有这些进展及更具挑战性数据集的创建,多数工作仍针对英语。此处,我们研究在多语言BERT上针对大规模英语阅读理解数据集(如RACE)微调的有效性,并将其应用于保加利亚语多选阅读理解。我们提出一个新数据集,含来自十二年级历史、生物、地理与哲学等多学科毕业考试的2,221道题,以及来自历史在线测验的412道附加题。虽然测验作者未给出相关上下文,我们融入来自Wikipedia的知识,检索匹配问题+各答案选项组合的文档。此外,我们尝试不同的索引与预训练策略。评估结果显示准确率为42.23%,远高于24.89%的基线。

关键词

引用

@article{arxiv.1908.01519,
  title  = {Beyond English-Only Reading Comprehension: Experiments in Zero-Shot Multilingual Transfer for Bulgarian},
  author = {Momchil Hardalov and Ivan Koychev and Preslav Nakov},
  journal= {arXiv preprint arXiv:1908.01519},
  year   = {2019}
}

备注

Accepted at RANLP 2019 (13 pages, 2 figures, 6 tables)