用于生成图像描述的深度视觉-语义对齐
计算机视觉与模式识别
2015-04-15 v2
摘要
我们提出了一个生成图像及其区域自然语言描述的模型。我们的方法利用图像及其句子描述的数据集,来学习语言与视觉数据之间的跨模态对应关系。我们的对齐模型基于一种新颖的组合:图像区域上的卷积神经网络、句子上的双向循环神经网络,以及通过多模态嵌入对齐这两种模态的结构化目标。随后,我们描述了一种多模态循环神经网络架构,该架构利用推断出的对齐来学习生成图像区域的新颖描述。我们证明,我们的对齐模型在 Flickr8K、Flickr30K 和 MSCOCO 数据集的检索实验中取得了当前最优结果。我们随后表明,在完整图像和新的区域级标注数据集上,生成的描述均显著优于检索基线。
引用
@article{arxiv.1412.2306,
title = {Deep Visual-Semantic Alignments for Generating Image Descriptions},
author = {Andrej Karpathy and Li Fei-Fei},
journal= {arXiv preprint arXiv:1412.2306},
year = {2015}
}