原生中文读者:面向母语级中文机器阅读理解的数据集
计算与语言
2021-12-15 v2
摘要
我们提出原生中文读者(Native Chinese Reader, NCR),这是一个包含现代与古典中文超长文章的新型机器阅读理解(MRC)数据集。NCR 收集自中国高中语文课程的考试题目,旨在评估母语青少年的语言能力。现有的中文 MRC 数据集要么领域特定,要么仅关注现代中文中数百字的短文本。相比之下,NCR 包含 8390 篇文档,平均长度为 1024 字,涵盖广泛的汉语写作风格,包括现代文章、古典文学与古典诗歌。这些文档上的共计 20477 道问题还需要较强的推理能力与常识以得出正确答案。我们使用流行的汉语预训练模型实现了多种基线模型,并额外基于该数据集举办了在线竞赛以检验当前方法的极限。最佳模型取得 59% 的测试准确率,而人工评测显示平均准确率为 79%,这表明当前 MRC 模型与母语者之间存在显著的性能差距。我们在 https://sites.google.com/view/native-chinese-reader/ 发布了该数据集。
引用
@article{arxiv.2112.06494,
title = {Native Chinese Reader: A Dataset Towards Native-Level Chinese Machine Reading Comprehension},
author = {Shusheng Xu and Yichen Liu and Xiaoyu Yi and Siyuan Zhou and Huizi Li and Yi Wu},
journal= {arXiv preprint arXiv:2112.06494},
year = {2021}
}
备注
17 pages, 1 fiugres, accepted by NeurIPS 2021 Track on Datasets and Benchmarks