用于图像描述的注意力之上的注意力机制
计算机视觉与模式识别
2019-08-22 v2
摘要
注意力机制在当前图像描述的编码器/解码器框架中被广泛使用,其中在每个时间步生成编码向量的加权平均以引导描述解码过程。然而,解码器几乎不知道被关注向量与给定注意力查询是否相关或相关程度如何,这可能使解码器给出被误导的结果。在本文中,我们提出一种注意力之上的注意力(Attention on Attention, AoA)模块,它将常规注意力机制扩展以确定注意力结果与查询之间的相关性。AoA首先利用注意力结果和当前上下文生成一个信息向量和一个注意力门,然后通过逐元素乘法对它们施加另一层注意力,最终获得被关注信息,即期望的有用知识。我们将AoA应用于我们的图像描述模型的编码器和解码器,将其命名为AoA网络(AoANet)。实验表明,AoANet优于所有先前发表的方法,并在MS COCO Karpathy离线测试集上取得了129.8 CIDEr-D分数、在官方在线测试服务器上取得129.6 CIDEr-D (C40)分数的新最优(state-of-the-art)性能。代码可在 https://github.com/husthuaan/AoANet 获取。
引用
@article{arxiv.1908.06954,
title = {Attention on Attention for Image Captioning},
author = {Lun Huang and Wenmin Wang and Jie Chen and Xiao-Yong Wei},
journal= {arXiv preprint arXiv:1908.06954},
year = {2019}
}
备注
Accepted to ICCV 2019 (Oral)