注意力卷积:为 CNN 配备 RNN 式注意力机制
计算与语言
2018-11-14 v2
摘要
在 NLP 中,卷积神经网络 (CNN) 从注意力机制中获益不如循环神经网络 (RNN) 多。我们假设这是因为 CNN 中的注意力主要实现为注意力池化(即应用于池化),而不是注意力卷积(即集成到卷积中)。卷积是 CNN 的差异化因素,因为它可以通过考虑输入文本 中词的局部固定大小上下文,强大地建模该词的高层表示。在这项工作中,我们提出了一种注意力卷积网络 ATTCONV。它扩展了卷积操作的上下文范围,不仅从局部上下文,还从 RNN 中常用的注意力机制提取的非局部上下文信息中为词推导高层特征。这种非局部上下文可以 (i) 来自距离较远的输入文本 部分,或 (ii) 来自额外(即外部)上下文 。在零上下文(情感分析)、单上下文(文本蕴含)和多上下文(声明验证)的句子建模实验中,证明了 ATTCONV 在结合上下文进行句子表示学习中的有效性。特别是,注意力卷积优于注意力池化,并且是流行的注意力 RNN 的强劲竞争对手。
引用
@article{arxiv.1710.00519,
title = {Attentive Convolution: Equipping CNNs with RNN-style Attention Mechanisms},
author = {Wenpeng Yin and Hinrich Schütze},
journal= {arXiv preprint arXiv:1710.00519},
year = {2018}
}
备注
Camera-ready for TACL. 16 pages