中文

注意力卷积:为 CNN 配备 RNN 式注意力机制

计算与语言 2018-11-14 v2

摘要

在 NLP 中,卷积神经网络 (CNN) 从注意力机制中获益不如循环神经网络 (RNN) 多。我们假设这是因为 CNN 中的注意力主要实现为注意力池化(即应用于池化),而不是注意力卷积(即集成到卷积中)。卷积是 CNN 的差异化因素,因为它可以通过考虑输入文本 txt^x 中词的局部固定大小上下文,强大地建模该词的高层表示。在这项工作中,我们提出了一种注意力卷积网络 ATTCONV。它扩展了卷积操作的上下文范围,不仅从局部上下文,还从 RNN 中常用的注意力机制提取的非局部上下文信息中为词推导高层特征。这种非局部上下文可以 (i) 来自距离较远的输入文本 txt^x 部分,或 (ii) 来自额外(即外部)上下文 tyt^y。在零上下文(情感分析)、单上下文(文本蕴含)和多上下文(声明验证)的句子建模实验中,证明了 ATTCONV 在结合上下文进行句子表示学习中的有效性。特别是,注意力卷积优于注意力池化,并且是流行的注意力 RNN 的强劲竞争对手。

关键词

引用

@article{arxiv.1710.00519,
  title  = {Attentive Convolution: Equipping CNNs with RNN-style Attention Mechanisms},
  author = {Wenpeng Yin and Hinrich Schütze},
  journal= {arXiv preprint arXiv:1710.00519},
  year   = {2018}
}

备注

Camera-ready for TACL. 16 pages