用于图像字幕的基于场景的因子化注意力
计算机视觉与模式识别
2019-09-04 v3
摘要
图像字幕在多媒體社区中吸引了日益增长的研究关注。为此,多数前沿工作依赖于带注意力机制的编码器-解码器框架,并取得了显著进展。然而,此类框架未考虑场景概念以关注视觉信息,导致字幕生成中的句子偏差并相应损害性能。我们认为此类场景概念捕捉更高层视觉语义,并作为描述图像的重要线索。本文提出一种新颖的用于图像字幕的基于场景的因子化注意力模块。具体而言,所提模块首先将场景概念显式嵌入因子化权重,并关注从输入图像提取的视觉信息。随后,使用自适应 LSTM 为特定场景类型生成字幕。在 Microsoft COCO 基准上的实验结果表明,所提基于场景的注意力模块大幅提升了模型性能,在各种评价指标下优于 state-of-the-art(最优)方法。
引用
@article{arxiv.1908.02632,
title = {Scene-based Factored Attention for Image Captioning},
author = {Chen Shen and Rongrong Ji and Fuhai Chen and Xiaoshuai Sun and Xiangming Li},
journal= {arXiv preprint arXiv:1908.02632},
year = {2019}
}
备注
10 pages