用于图像字幕的归一化与几何感知自注意力网络
计算机视觉与模式识别
2020-03-20 v1 计算与语言
多媒体
摘要
自注意力(SA)网络在图像字幕中已展现出深远价值。本文从两方面改进SA以提升图像字幕性能。首先,我们提出归一化自注意力(NSA),一种SA的重新参数化,将归一化益处引入SA内部。此前归一化仅应用于SA外部,我们引入一种新颖归一化方法,并证明在SA内部隐藏激活上执行归一化既可行又有益。其次,为弥补Transformer无法建模输入对象几何结构这一主要局限,我们提出一类几何感知自注意力(GSA),将SA扩展以显式且高效地考虑图像中对象间的相对几何关系。为构建图像字幕模型,我们将两模块结合并应用于原始自注意力网络。我们在MS-COCO图像字幕数据集上广泛评估所提方案,与最先进(SOTA)方法相比取得了更优结果。在视频字幕、机器翻译与视觉问答三个挑战性任务上的进一步实验显示了我们方法的通用性。
引用
@article{arxiv.2003.08897,
title = {Normalized and Geometry-Aware Self-Attention Network for Image Captioning},
author = {Longteng Guo and Jing Liu and Xinxin Zhu and Peng Yao and Shichen Lu and Hanqing Lu},
journal= {arXiv preprint arXiv:2003.08897},
year = {2020}
}
备注
Accepted by CVPR 2020