中文

利用段落向量构建大规模机器阅读理解数据集

计算与语言 2016-12-14 v1

摘要

我们对机器阅读理解任务做出了双重贡献:一种利用段落向量模型创建大规模机器阅读理解(MC)数据集的技术;以及一种新颖的混合神经网络架构,该架构结合了循环神经网络的表示能力与全连接多层网络的判别能力。我们使用该MC数据集生成技术构建了一个包含约200万个示例的数据集,并据此实证确定了人类表现的高上限(约91%的准确率),以及多种计算机模型的表现。在我们实验过的所有模型中,我们的混合神经网络架构取得了最高性能(83.2%的准确率)。与人类表现上限之间的剩余差距为未来模型改进提供了充足空间。

关键词

引用

@article{arxiv.1612.04342,
  title  = {Building Large Machine Reading-Comprehension Datasets using Paragraph Vectors},
  author = {Radu Soricut and Nan Ding},
  journal= {arXiv preprint arXiv:1612.04342},
  year   = {2016}
}

备注

10 pages