学习用于图像描述生成的循环视觉表示
计算机视觉与模式识别
2014-11-21 v1 人工智能
计算与语言
摘要
本文探索了图像与其基于句子的描述之间的双向映射。我们提出使用循环神经网络学习这种映射。与以往将句子和图像映射到共同嵌入空间的方法不同,我们能够根据给定图像生成新颖的句子。使用同一模型,我们还可以根据图像的视觉描述重建与之关联的视觉特征。我们采用了一种新颖的循环视觉记忆,它能自动学习记忆长期的视觉概念,以辅助句子生成和视觉特征重建。我们在多个任务上评估了我们的方法,包括句子生成、句子检索和图像检索。在生成新颖图像描述的任务上,我们展示了当前最优的结果。与人类生成的描述相比,我们自动生成的描述在 19.8% 的情况下更受人类青睐。在使用相似视觉特征的方法中,我们的方法在图像和句子检索任务上的结果优于或可比肩当前最优结果。
引用
@article{arxiv.1411.5654,
title = {Learning a Recurrent Visual Representation for Image Caption Generation},
author = {Xinlei Chen and C. Lawrence Zitnick},
journal= {arXiv preprint arXiv:1411.5654},
year = {2014}
}