中文

BiPaR:面向小说多语言与跨语言阅读理解的双语平行数据集

计算与语言 2019-10-14 v1 人工智能

摘要

本文提出 BiPaR,一个双语平行的小说风格机器阅读理解(MRC)数据集,旨在支持多语言与跨语言阅读理解。BiPaR 与现有阅读理解数据集最大的区别在于,其中每个三元组(篇章、问题、答案)均以两种语言平行撰写。我们从中英小说中收集了 3,667 个双语平行段落,并通过众包工作者在严格的质量控制流程下构建了 14,668 个平行问答对。我们深入分析了 BiPaR,发现其在问题前缀、答案类型以及问题与篇章的关系方面具有良好的多样性。我们还观察到,回答小说中的问题需要共指消解、多句推理以及理解隐式因果关系等阅读理解技能。基于 BiPaR,我们构建了单语、多语和跨语言 MRC 基线模型。即便对于该数据集上相对简单的单语 MRC,实验表明强大的 BERT 基线在 EM 和 F1 分数上均落后人类超过 30 分,这表明 BiPaR 为小说上的单语、多语和跨语言 MRC 提供了一个具有挑战性的测试平台。数据集可从 https://multinlp.github.io/BiPaR/ 获取。

关键词

引用

@article{arxiv.1910.05040,
  title  = {BiPaR: A Bilingual Parallel Dataset for Multilingual and Cross-lingual Reading Comprehension on Novels},
  author = {Yimin Jing and Deyi Xiong and Yan Zhen},
  journal= {arXiv preprint arXiv:1910.05040},
  year   = {2019}
}

备注

Accepted as a long paper at EMNLP 2019