中文

知道何时去观察:基于视觉哨兵的自适应注意力图像描述

计算机视觉与模式识别 2017-06-07 v2 人工智能

摘要

基于注意力的神经编码器-解码器框架已被广泛应用于图像描述。大多数方法强制视觉注意力对每个生成的词都保持激活。然而,解码器在预测诸如“the”和“of”等非视觉词时,可能几乎不需要或完全不需要图像的视觉信息。其他看似视觉的词通常仅靠语言模型就能可靠预测,例如“behind a red stop”之后的“sign”,或“talking on a cell”之后的“phone”。在本文中,我们提出了一种带有视觉哨兵的新型自适应注意力模型。在每个时间步,我们的模型决定是关注图像(如果是,关注哪些区域)还是关注视觉哨兵。模型决定是否关注图像以及关注何处,从而为序列词生成提取有意义的信息。我们在 COCO image captioning 2015 challenge 数据集和 Flickr30K 上测试了我们的方法。我们的方法以显著优势确立了新的 state-of-the-art。

关键词

引用

@article{arxiv.1612.01887,
  title  = {Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning},
  author = {Jiasen Lu and Caiming Xiong and Devi Parikh and Richard Socher},
  journal= {arXiv preprint arXiv:1612.01887},
  year   = {2017}
}

备注

12 pages, 11 figures, CVPR2017 camera ready