首届中文机器阅读理解评测数据集
计算与语言
2018-03-16 v2
摘要
机器阅读理解(MRC)近来变得极其流行并吸引了大量关注。然而,现有的阅读理解数据集大多为英文。为了增加阅读理解数据集的多样性,本文提出一个新的中文阅读理解数据集以推动社区相关研究。该数据集包含两种不同类型:完形填空式阅读理解和用户查询阅读理解,并配有大规模训练数据以及人工标注的验证集和隐藏测试集。连同该数据集,我们还举办了首届中文机器阅读理解评测(CMRC-2017),并成功吸引了数十名参与者,这表明了该数据集的潜在影响。
引用
@article{arxiv.1709.08299,
title = {Dataset for the First Evaluation on Chinese Machine Reading Comprehension},
author = {Yiming Cui and Ting Liu and Zhipeng Chen and Wentao Ma and Shijin Wang and Guoping Hu},
journal= {arXiv preprint arXiv:1709.08299},
year = {2018}
}
备注
5 pages, published at LREC 2018