SCA-CNN:用于图像描述的卷积网络中空间与通道维度的注意力机制
计算机视觉与模式识别
2017-04-13 v2
摘要
视觉注意力已成功应用于视觉描述和问答等结构化预测任务。现有的视觉注意力模型通常是空间性的,即注意力被建模为空间概率,用于对编码输入图像的CNN最后一层卷积特征图进行重新加权。然而,我们认为这种空间注意力并不必然符合注意力机制——一种随时间组合上下文注视点的动态特征提取器,因为CNN特征本质上是空间性、通道性且多层的。本文中,我们引入了一种新颖的卷积神经网络,称为SCA-CNN,它在CNN中融合了空间注意力与通道注意力。在图像描述任务中,SCA-CNN动态调制多层特征图中的句子生成上下文,编码视觉注意力在何处(即多层中的注意力空间位置)以及是什么(即注意力通道)。我们在三个基准图像描述数据集上评估了所提出的SCA-CNN架构:Flickr8K、Flickr30K和MSCOCO。一致观察到,SCA-CNN显著优于当前最先进的基于视觉注意力的图像描述方法。
引用
@article{arxiv.1611.05594,
title = {SCA-CNN: Spatial and Channel-wise Attention in Convolutional Networks for Image Captioning},
author = {Long Chen and Hanwang Zhang and Jun Xiao and Liqiang Nie and Jian Shao and Wei Liu and Tat-Seng Chua},
journal= {arXiv preprint arXiv:1611.05594},
year = {2017}
}