中文

探究先验知识在具有挑战性的中文机器阅读理解中的作用

计算与语言 2019-12-18 v3

摘要

机器阅读理解任务要求机器阅读器回答与给定文档相关的问题。在本文中,我们提出了首个自由形式多选中文机器阅读理解数据集(C^3),包含从汉语作为第二语言考试中收集的 13,369 篇文档(对话或较正式书写的混合体裁文本)及其相关的 19,577 道自由形式多选问题。我们对这些真实世界问题所需的先验知识(即语言、领域特定和一般世界知识)进行了全面分析。我们实现了基于规则的和流行的神经方法,发现表现最佳的模型(68.5%)与人类阅读者(96.0%)之间仍存在显著性能差距,尤其是在需要先验知识的问题上。我们进一步研究了干扰项合理性和基于翻译的相关英文数据集进行数据增强对模型性能的影响。我们期望 C^3 对现有系统提出巨大挑战,因为回答 86.8% 的问题需要文档内和文档外的知识,并且我们希望 C^3 能作为一个平台来研究如何利用各种先验知识以更好地理解给定的书面或口语导向文本。C^3 可在 https://dataset.org/c3/ 获取。

关键词

引用

@article{arxiv.1904.09679,
  title  = {Investigating Prior Knowledge for Challenging Chinese Machine Reading Comprehension},
  author = {Kai Sun and Dian Yu and Dong Yu and Claire Cardie},
  journal= {arXiv preprint arXiv:1904.09679},
  year   = {2019}
}

备注

To appear in TACL