中文

一种用于图像描述的半监督框架

计算机视觉与模式识别 2017-06-27 v3

摘要

当前最先进的图像描述方法需要由成对的图像数据及其描述组成的监督训练数据。这些方法通常无法利用无监督数据,例如没有对应图像的文本数据,而这类数据要丰富得多。本文提出了一种利用此类文本数据的新方法,即通过人工生成缺失的视觉信息。我们在一个新设计的模型上评估了这种学习方法,该模型检测图像中存在的视觉概念,并将其馈送到一个带有注意力机制的审阅者-解码器架构中。与以往使用词嵌入编码视觉概念的方法不同,我们建议使用区域图像特征,这些特征能捕获更本质的信息。该架构的主要优点是,它能合成有意义的思想向量,以捕获显著的图像属性,然后应用软注意力解码器来解码这些思想向量并生成图像描述。我们在Microsoft COCO和Flickr30K数据集上评估了我们的模型,并证明该模型与我们的半监督学习方法相结合,可以大幅提升性能,并帮助模型生成更准确、更多样化的描述。

关键词

引用

@article{arxiv.1611.05321,
  title  = {A Semi-supervised Framework for Image Captioning},
  author = {Wenhu Chen and Aurelien Lucchi and Thomas Hofmann},
  journal= {arXiv preprint arXiv:1611.05321},
  year   = {2017}
}