面向中文机器阅读理解的片段抽取数据集
计算与语言
2019-11-05 v2
摘要
机器阅读理解(MRC)近来变得极为流行并吸引了大量关注。然而,现有的阅读理解数据集多为英文。本文引入一个面向中文机器阅读的片段抽取(Span-Extraction)数据集,以增添该领域的语言多样性。该数据集由人类专家在维基百科段落上标注的近 20,000 条真实问题构成。我们还标注了一个挑战集,其中包含需要通读全文进行综合理解与多句推理的问题。我们给出了若干基线系统以及匿名提交以展示该数据集的难度。随着数据集发布,我们主办了第二届中文机器阅读理解评测研讨会(CMRC 2018)。我们希望该数据集的发布能进一步加速中文机器阅读理解研究。资源可用:https://github.com/ymcui/cmrc2018
引用
@article{arxiv.1810.07366,
title = {A Span-Extraction Dataset for Chinese Machine Reading Comprehension},
author = {Yiming Cui and Ting Liu and Wanxiang Che and Li Xiao and Zhipeng Chen and Wentao Ma and Shijin Wang and Guoping Hu},
journal= {arXiv preprint arXiv:1810.07366},
year = {2019}
}
备注
6 pages, accepted as a conference paper at EMNLP-IJCNLP 2019 (short paper)