中文

用于图像描述的注意力区域

计算机视觉与模式识别 2017-08-28 v2

摘要

我们提出了“注意力区域”,一种用于自动图像描述的基于注意力的新模型。我们的方法使用三种成对交互,对图像区域、描述词与 RNN 语言模型状态之间的依赖关系进行建模。与以往仅将图像区域关联到 RNN 状态的基于注意力的方法不同,我们的方法允许描述词与图像区域之间的直接关联。在训练期间,这些关联是从图像级描述中推断出来的,类似于弱监督目标检测器训练。这些关联通过在测试期间定位相应区域来帮助改进描述。我们还提出并比较了生成注意力区域的不同方法:CNN 激活网格、目标候选框以及以卷积方式应用的空间变换网络。空间变换给出了最佳结果。它们允许图像特定的注意力区域,并且可以与网络的其余部分联合训练。我们的注意力机制和空间变换注意力区域共同在 MSCOCO 数据集上取得了 SOTA 结果。

关键词

引用

@article{arxiv.1612.01033,
  title  = {Areas of Attention for Image Captioning},
  author = {Marco Pedersoli and Thomas Lucas and Cordelia Schmid and Jakob Verbeek},
  journal= {arXiv preprint arXiv:1612.01033},
  year   = {2017}
}

备注

Accepted in ICCV 2017