面向多样对象生成图像描述
计算机视觉与模式识别
2017-07-24 v3 计算与语言
摘要
当前的图像描述模型在扩展能力以及描述未见于配对图文语料库中的概念方面存在局限。我们提出新颖对象描述器(Novel Object Captioner, NOC),这是一种深度视觉语义描述模型,能够描述现有图像描述数据集中未出现的大量对象类别。该模型利用外部资源——来自对象识别数据集的标注图像,以及从未标注文本中提取的语义知识。我们提出最小化一个联合目标函数,该函数能够从这些多样数据源中学习并利用分布语义嵌入,使模型能够泛化并描述图像描述数据集之外的新颖对象。我们证明,该模型利用语义信息,能够为 ImageNet 对象识别数据集中数百个在 MSCOCO 图像描述训练数据中未出现的对象类别,以及许多极少出现的类别生成描述。自动评估与人工评判均表明,我们的模型在描述更多对象类别方面显著优于先前工作。
引用
@article{arxiv.1606.07770,
title = {Captioning Images with Diverse Objects},
author = {Subhashini Venugopalan and Lisa Anne Hendricks and Marcus Rohrbach and Raymond Mooney and Trevor Darrell and Kate Saenko},
journal= {arXiv preprint arXiv:1606.07770},
year = {2017}
}
备注
CVPR 2017 Camera ready version. 17 pages (8 + 9 supplement), 12 figures, 8 tables. Includes project page http://vsubhashini.github.io/noc.html