DRCD:一个中文机器阅读理解数据集
计算与语言
2019-05-30 v3
摘要
在本文中,我们介绍了 DRCD(Delta Reading Comprehension Dataset),一个开放域繁体中文机器阅读理解(MRC)数据集。该数据集旨在成为一个标准的中文机器阅读理解数据集,可作为迁移学习中的源数据集。该数据集包含来自 2,108 篇维基百科文章的 10,014 个段落,以及由标注者生成的 30,000+ 个问题。我们构建了一个基线模型,其 F1 分数为 89.59%。人类表现的 F1 分数为 93.30%。
引用
@article{arxiv.1806.00920,
title = {DRCD: a Chinese Machine Reading Comprehension Dataset},
author = {Chih Chieh Shao and Trois Liu and Yuting Lai and Yiying Tseng and Sam Tsai},
journal= {arXiv preprint arXiv:1806.00920},
year = {2019}
}
备注
5 pages