用于图像字幕的门控分层注意力
计算机视觉与模式识别
2018-11-01 v2 人工智能
摘要
连接编码器与解码器的注意力模块已广泛应用于物体识别、图像字幕、视觉问答和神经机器翻译领域,并显著提升了性能。本文中,我们提出一种自底向上的门控分层注意力(GHA)机制用于图像字幕。我们提出的模型采用CNN作为解码器,能够在不同层学习不同概念,且显然不同概念对应于图像的不同区域。因此,我们开发了GHA,其中低层概念被合并入高层概念,同时低层注意力特征传递至顶层以进行预测。我们的GHA显著提升了仅应用单层注意力的模型性能,例如CIDEr分数从0.923增至0.999,可与采用属性增强与强化学习(RL)的最先进模型相媲美。我们还进行了大量实验以分析CNN解码器与我们提出的GHA,发现更深的解码器无法获得更好性能,且当卷积解码器变深时模型在训练期间容易崩溃。
引用
@article{arxiv.1810.12535,
title = {Gated Hierarchical Attention for Image Captioning},
author = {Qingzhong Wang and Antoni B. Chan},
journal= {arXiv preprint arXiv:1810.12535},
year = {2018}
}
备注
Accepted by ACCV