中文

Sherlock:图像中可扩展的事实学习

计算机视觉与模式识别 2016-04-05 v4 计算与语言 机器学习

摘要

我们研究图像中事实的可扩展且统一的理解。现有的视觉识别系统通常针对每种事实类型(如对象、动作和交互)采用不同的建模方式。我们提出了一种设定,其中所有这类事实可以同时建模,并具备以结构化方式理解无界数量事实的能力。训练数据以图像中的结构化事实形式给出,包括(1)对象(例如<<boy>>)、(2)属性(例如<<boy, tall>>)、(3)动作(例如<<boy, playing>>)和(4)交互(例如<<boy, riding, a horse>>)。每个事实都有一个语义语言视图(例如<<boy, playing>>)和一个视觉视图(带有该事实的图像)。我们表明,以结构化方式学习视觉事实不仅支持统一的视觉理解,而且支持可泛化的视觉理解。我们提出并研究了多视图学习文献中近期且强大的方法,并引入了两个学习表示模型作为潜在基线。我们将所研究的方法应用于我们增强了结构化事实的多个数据集以及一个包含超过202,000个事实和814,000张图像的大规模数据集。我们的实验显示了在双向事实检索上,所提模型通过结构关联事实相比设计的基线具有优势。

关键词

引用

@article{arxiv.1511.04891,
  title  = {Sherlock: Scalable Fact Learning in Images},
  author = {Mohamed Elhoseiny and Scott Cohen and Walter Chang and Brian Price and Ahmed Elgammal},
  journal= {arXiv preprint arXiv:1511.04891},
  year   = {2016}
}

备注

Jan 7 Update