中文

面向中文机器阅读理解的句子完形填空数据集

计算与语言 2021-05-17 v2

摘要

得益于中文 NLP 社区持续的努力,越来越多的中文机器阅读理解数据集得以问世。为增加该领域的多样性,本文提出一项称为句子完形填空式机器阅读理解(SC-MRC)的新任务。所提任务旨在将正确的候选句子填入含有若干空白的篇章中。我们构建了一个名为 CMRC 2019 的中文数据集以评估 SC-MRC 任务的难度。此外,为增加难度,我们还制作了与正确候选句相似的干扰候选句,要求机器在上下文中判断其正确性。所提数据集包含来自中文叙事故事的 1 万余篇篇章中的超过 10 万个空白(问题)。为评估该数据集,我们基于预训练模型实现了若干基线系统,结果显示最先进的模型仍大幅落后于人类表现。我们发布数据集与基线系统以进一步促进社区发展。资源可通过 https://github.com/ymcui/cmrc2019 获取。

关键词

引用

@article{arxiv.2004.03116,
  title  = {A Sentence Cloze Dataset for Chinese Machine Reading Comprehension},
  author = {Yiming Cui and Ting Liu and Ziqing Yang and Zhipeng Chen and Wentao Ma and Wanxiang Che and Shijin Wang and Guoping Hu},
  journal= {arXiv preprint arXiv:2004.03116},
  year   = {2021}
}

备注

7 pages, to appear at COLING 2020