中文

用于图像描述的文本引导注意力模型

计算机视觉与模式识别 2016-12-13 v1

摘要

视觉注意力在理解图像方面发挥着重要作用,并展示了其在生成图像自然语言描述方面的有效性。另一方面,最近的研究表明,在我们的认知过程中,与图像相关的语言可以引导场景中的视觉注意力。受此启发,我们引入了一种用于图像描述的文本引导注意力模型,该模型学习使用相关描述来驱动视觉注意力。对于该模型,我们提出了一种基于样例的学习方法,该方法从训练数据中检索与每张图像相关的描述,并利用它们来学习对视觉特征的注意力。我们的注意力模型能够通过有效区分微小或易混淆的物体来描述场景的详细状态。我们在 MS-COCO 描述基准上验证了我们的模型,并在标准指标上取得了 SOTA 性能。

关键词

引用

@article{arxiv.1612.03557,
  title  = {Text-guided Attention Model for Image Captioning},
  author = {Jonghwan Mun and Minsu Cho and Bohyung Han},
  journal= {arXiv preprint arXiv:1612.03557},
  year   = {2016}
}