中文

基于上下文不可知监督的上下文感知图像描述

计算机视觉与模式识别 2017-08-02 v3 人工智能

摘要

我们引入一种推断技术,仅使用通用的上下文不可知训练数据(描述孤立概念或图像的描述),来生成区分性的上下文感知图像描述(描述图像或视觉概念之间差异的描述)。例如,给定“暹罗猫”和“虎斑猫”的图像与描述,我们生成以区别于“虎斑猫”的方式描述“暹罗猫”的语言。我们的关键创新在于展示了如何对上下文不可知的语言模型与区分密切相关概念的听者进行联合推断。我们首先将我们的技术应用于一个论证任务,即描述为何一幅图像包含特定的细粒度类别而非 CUB-200-2011 数据集中的另一个密切相关类别。然后我们研究区分性图像描述,以生成唯一指代 COCO 数据集中两张语义相似图像之一的语言。利用区分性真值对论证任务进行评估,以及对区分性图像描述进行人类研究,表明我们的方法在区分性上优于基线的生成式和说话者-听者方法。

关键词

引用

@article{arxiv.1701.02870,
  title  = {Context-aware Captions from Context-agnostic Supervision},
  author = {Ramakrishna Vedantam and Samy Bengio and Kevin Murphy and Devi Parikh and Gal Chechik},
  journal= {arXiv preprint arXiv:1701.02870},
  year   = {2017}
}

备注

Accepted to CVPR 2017 (Spotlight)