中文

谁做了什么:一个大规模以人物为中心的完形填空数据集

计算与语言 2016-08-22 v1

摘要

我们构建了一个新的“谁做了什么”(Who-did-What)数据集,包含超过200,000个从LDC English Gigaword新闻语料库构建的填空(cloze)多选阅读理解问题。WDW数据集具有多种新颖特征。首先,与CNN和Daily Mail数据集(Hermann等人,2015)不同,我们避免使用文章摘要来生成问题。相反,每个问题由两篇独立的文章构成——一篇作为待阅读段落给出,另一篇关于相同事件的文章用于生成问题。其次,我们避免匿名化——每个选择项都是一个人物命名实体。第三,这些问题经过筛选,去除了部分可被简单基线轻易解决的部分,而剩余84%可被人类解决。我们报告了标准系统的性能基准,并提议将WDW数据集作为社区的一项挑战任务。

关键词

引用

@article{arxiv.1608.05457,
  title  = {Who did What: A Large-Scale Person-Centered Cloze Dataset},
  author = {Takeshi Onishi and Hai Wang and Mohit Bansal and Kevin Gimpel and David McAllester},
  journal= {arXiv preprint arXiv:1608.05457},
  year   = {2016}
}

备注

To appear at EMNLP 2016. Our dataset is available at tticnlp.github.io/who_did_what