中文

面向跨语言阅读理解零样本多语言合成问答生成

计算与语言 2021-06-01 v3 人工智能 机器学习

摘要

我们提出一种简单方法,通过使用单一生成模型大规模生成多语言问答对。这些合成样本可用于提升多语言问答模型在目标语言上的零样本性能。我们提出的生成模型多任务训练仅需要英语标注训练样本,从而免除了对目标语言此类样本的需求,使其可应用于远比具有标注数据的语言更多的语言。人工评估表明此类样本大多数在语法上正确且合理。实验结果显示我们提出的方法在XQuAD数据集上能取得大幅增益,缩小了较小问答模型在各语言上零样本与有监督性能之间的差距。

关键词

引用

@article{arxiv.2010.12008,
  title  = {Towards Zero-Shot Multilingual Synthetic Question and Answer Generation for Cross-Lingual Reading Comprehension},
  author = {Siamak Shakeri and Noah Constant and Mihir Sanjay Kale and Linting Xue},
  journal= {arXiv preprint arXiv:2010.12008},
  year   = {2021}
}