中文

基于引导对象的意图导向图像描述

计算机视觉与模式识别 2019-04-12 v2

摘要

尽管现有图像描述模型利用循环神经网络(RNNs)可取得良好结果,但难以保证我们所关注的物体被包含在生成的描述中,例如当该物体在图像中不显著时。当这些物体未在训练阶段出现时,问题更加困难。本文提出一种生成带引导对象的图像描述(CGO)的新方法。CGO在物体存在于图像中时,约束模型使其包含人关注的物体。CGO确保物体出现在生成描述中,同时保持流畅性。与从左向右生成序列不同,我们以选定物体开始描述,并基于该物体生成序列的其他部分。为此,我们设计了一种结合两个反向LSTM的新框架。我们在MSCOCO上展示了方法特性,为图像中每个检测到的物体生成描述。借助CGO,我们可将描述能力扩展到图像描述标签中被忽略的物体,并为图像提供一组更全面多样的描述。CGO在描述新物体任务中展现优势。我们在MSCOCO和ImageNet数据集上给出实验结果。评估表明,我们的方法在该任务中以平均F1 75.8优于最先进模型,在内容准确性与流畅性方面均带来更好描述。

关键词

引用

@article{arxiv.1811.07662,
  title  = {Intention Oriented Image Captions with Guiding Objects},
  author = {Yue Zheng and Yali Li and Shengjin Wang},
  journal= {arXiv preprint arXiv:1811.07662},
  year   = {2019}
}