中文

DREAM:面向基于对话的阅读理解的挑战数据集与模型

计算与语言 2019-02-04 v1

摘要

我们提出 DREAM,首个基于对话的多项选择阅读理解数据集。我们的数据集收集自由人类专家设计、用于评估中国英语学习者理解水平的英语作为外语考试中,包含 6,444 段对话的 10,197 道多项选择题。与现有阅读理解数据集不同,DREAM 首个聚焦于深度的多轮多方对话理解。DREAM 可能对现有阅读理解系统构成重大挑战:84% 的答案为非抽取式,85% 的问题需要超越单句的推理,34% 的问题还涉及常识知识。我们应用了几种主要利用文本内表层信息的流行神经阅读理解模型,发现它们至多仅勉强优于基于规则的方法。接下来,我们研究了将对话结构和不同种类的通用世界知识引入基于规则以及(神经与非神经)机器学习的阅读理解模型中的效果。在 DREAM 数据集上的实验结果表明了对话结构和通用世界知识的有效性。DREAM 将于 https://dataset.org/dream/ 提供。

关键词

引用

@article{arxiv.1902.00164,
  title  = {DREAM: A Challenge Dataset and Models for Dialogue-Based Reading Comprehension},
  author = {Kai Sun and Dian Yu and Jianshu Chen and Dong Yu and Yejin Choi and Claire Cardie},
  journal= {arXiv preprint arXiv:1902.00164},
  year   = {2019}
}

备注

To appear in TACL