DuReader:一个源自真实应用场景的中文机器阅读理解数据集
计算与语言
2018-06-12 v4
摘要
本文介绍DuReader,一个大规模、开放域的中文机器阅读理解(MRC)新数据集,旨在解决真实场景下的机器阅读理解问题。相较于以往的MRC数据集,DuReader具有三点优势:(1)数据来源:问题与文档基于百度搜索和百度知道;答案由人工生成。(2)问题类型:它对更多问题类型提供了丰富标注,尤其是是非题与观点题,为研究界留下更多探索空间。(3)规模:它包含20万问题、42万答案和100万文档;是迄今最大的中文MRC数据集。实验表明,人类表现远高于当前最先进的基线系统,为学界留下了充足的改进空间。为助力学界改进,DuReader与基线系统均已在线发布。我们还组织了共享竞赛以鼓励对更多模型的探索。自任务发布以来,相较基线已有显著改进。
引用
@article{arxiv.1711.05073,
title = {DuReader: a Chinese Machine Reading Comprehension Dataset from Real-world Applications},
author = {Wei He and Kai Liu and Jing Liu and Yajuan Lyu and Shiqi Zhao and Xinyan Xiao and Yuan Liu and Yizhong Wang and Hua Wu and Qiaoqiao She and Xuan Liu and Tian Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:1711.05073},
year = {2018}
}
备注
10 pages, ACL 2018 MRQA Workshop camera-ready version