中文

用于图像字幕的基于场景的因子化注意力

计算机视觉与模式识别 2019-09-04 v3

摘要

图像字幕在多媒體社区中吸引了日益增长的研究关注。为此,多数前沿工作依赖于带注意力机制的编码器-解码器框架,并取得了显著进展。然而,此类框架未考虑场景概念以关注视觉信息,导致字幕生成中的句子偏差并相应损害性能。我们认为此类场景概念捕捉更高层视觉语义,并作为描述图像的重要线索。本文提出一种新颖的用于图像字幕的基于场景的因子化注意力模块。具体而言,所提模块首先将场景概念显式嵌入因子化权重,并关注从输入图像提取的视觉信息。随后,使用自适应 LSTM 为特定场景类型生成字幕。在 Microsoft COCO 基准上的实验结果表明,所提基于场景的注意力模块大幅提升了模型性能,在各种评价指标下优于 state-of-the-art(最优)方法。

关键词

引用

@article{arxiv.1908.02632,
  title  = {Scene-based Factored Attention for Image Captioning},
  author = {Chen Shen and Rongrong Ji and Fuhai Chen and Xiaoshuai Sun and Xiangming Li},
  journal= {arXiv preprint arXiv:1908.02632},
  year   = {2019}
}

备注

10 pages