拥抱数据丰富性:用于阅读理解的 BookTest 数据集
计算与语言
2016-10-05 v1 人工智能
机器学习
神经与进化计算
摘要
目前可用的自然语言数据量几乎是无限的。然而,最近的文本理解研究仍聚焦于相对于当前计算能力而言规模较小的数据集。本文呼吁学界转向更大规模的数据,作为朝此方向迈出的一步,本文提出了 BookTest,一个与流行的 Children's Book Test (CBT) 相似但规模大 60 倍以上的新数据集。我们表明,在新数据上训练使得我们的 Attention-Sum Reader 模型在原始 CBT 测试数据上的准确率提升幅度,远大于近期许多改进模型架构的尝试。在该数据集的一个版本上,我们的集成模型甚至超越了 Facebook 提供的人类基线。随后我们通过自身的人类研究表明,仍有进一步提升的空间。
引用
@article{arxiv.1610.00956,
title = {Embracing data abundance: BookTest Dataset for Reading Comprehension},
author = {Ondrej Bajgar and Rudolf Kadlec and Jan Kleindienst},
journal= {arXiv preprint arXiv:1610.00956},
year = {2016}
}
备注
The first two authors contributed equally to this work. Submitted to EACL 2017. Code and dataset are publicly available