中文

DRCD:一个中文机器阅读理解数据集

计算与语言 2019-05-30 v3

摘要

在本文中,我们介绍了 DRCD(Delta Reading Comprehension Dataset),一个开放域繁体中文机器阅读理解(MRC)数据集。该数据集旨在成为一个标准的中文机器阅读理解数据集,可作为迁移学习中的源数据集。该数据集包含来自 2,108 篇维基百科文章的 10,014 个段落,以及由标注者生成的 30,000+ 个问题。我们构建了一个基线模型,其 F1 分数为 89.59%。人类表现的 F1 分数为 93.30%。

关键词

引用

@article{arxiv.1806.00920,
  title  = {DRCD: a Chinese Machine Reading Comprehension Dataset},
  author = {Chih Chieh Shao and Trois Liu and Yuting Lai and Yiying Tseng and Sam Tsai},
  journal= {arXiv preprint arXiv:1806.00920},
  year   = {2019}
}

备注

5 pages