中文

面向无监督图像描述生成与共享多模态嵌入

计算机视觉与模式识别 2019-08-27 v1

摘要

在无显式监督下理解图像已成为计算机视觉中的一个重要问题。在本文中,我们通过生成场景的语言描述来解决图像描述生成问题,而无需从图像及其描述的标注对中学习。我们方法的核心是一个由视觉概念构建的共享潜在空间。在该空间中,两种模态应当不可区分。首先训练一个语言模型将句子编码为语义结构化的嵌入。被转换到该嵌入空间的图像特征可通过同一语言模型解码为描述,类似于句子嵌入。这一转换是利用弱配对图像与文本、使用对噪声分配鲁棒的损失以及一个条件对抗分量来学习的。我们的方法允许利用标注图像/描述数据分布之外的庞大文本语料库。我们的实验表明,所提出的域对齐学习到了语义上有意义的表示,优于先前的工作。

关键词

引用

@article{arxiv.1908.09317,
  title  = {Towards Unsupervised Image Captioning with Shared Multimodal Embeddings},
  author = {Iro Laina and Christian Rupprecht and Nassir Navab},
  journal= {arXiv preprint arXiv:1908.09317},
  year   = {2019}
}

备注

ICCV 2019