通过自适应注意力时间实现自适应对齐的图像描述
计算机视觉与模式识别
2020-01-07 v3 计算与语言
摘要
近年来用于图像描述的神经模型通常采用带有注意力机制的编码器-解码器框架。然而,这种框架中的注意力机制将一个单一的(被注意的)图像特征向量与一个描述词对齐,假设源图像区域和目标描述词之间存在一对一的映射,这从来都是不可能的。在本文中,我们提出了一种新颖的注意力模型,即自适应注意力时间 (AAT),用于图像描述中自适应地对齐源和目标。AAT 允许框架学习在每个解码步骤输出一个描述词需要采取多少步注意力。通过 AAT,一个图像区域可以映射到任意数量的描述词,同时一个描述词也可以关注任意数量的图像区域。AAT 是确定性和可微的,并且不会给参数梯度引入任何噪声。在本文中,我们通过实验证明 AAT 在图像描述任务上优于最先进的方法。代码可在 https://github.com/husthuaan/AAT 获取。
引用
@article{arxiv.1909.09060,
title = {Adaptively Aligned Image Captioning via Adaptive Attention Time},
author = {Lun Huang and Wenmin Wang and Yaxian Xia and Jie Chen},
journal= {arXiv preprint arXiv:1909.09060},
year = {2020}
}
备注
Accepted to NeurIPS 2019. Code is available at https://github.com/husthuaan/AAT