中文

QANet:结合局部卷积与全局自注意力的阅读理解模型

计算与语言 2018-04-26 v1 人工智能 机器学习

摘要

当前端到端的机器阅读与问答(Q&A)模型主要基于带注意力的循环神经网络(RNNs)。尽管取得了成功,由于 RNNs 的序列特性,这些模型在训练和推理时往往较慢。我们提出一种名为 QANet 的新问答架构,它不需要循环网络:其编码器仅由卷积和自注意力组成,其中卷积建模局部交互,自注意力建模全局交互。在 SQuAD 数据集上,我们的模型训练速度提高 3 至 13 倍,推理速度提高 4 至 9 倍,同时达到与循环模型相当的准确率。这种加速优势使我们能用更多数据训练模型。因此,我们将模型与神经机器翻译模型反向翻译生成的数据相结合。在 SQuAD 数据集上,我们经数据增广训练的单一模型在测试集上取得 84.6 的 F1 分数,显著优于已发表的最佳 F1 分数 81.8。

关键词

引用

@article{arxiv.1804.09541,
  title  = {QANet: Combining Local Convolution with Global Self-Attention for Reading Comprehension},
  author = {Adams Wei Yu and David Dohan and Minh-Thang Luong and Rui Zhao and Kai Chen and Mohammad Norouzi and Quoc V. Le},
  journal= {arXiv preprint arXiv:1804.09541},
  year   = {2018}
}

备注

Published as full paper in ICLR 2018