中文

基于视觉情境主动定位的语义图像检索

计算机视觉与模式识别 2017-11-02 v1

摘要

我们描述了一种用于语义图像检索——特别是视觉情境实例检索——的新架构。视觉情境是诸如“一场拳击比赛”“遛狗”“等候公交的人群”或“乒乓球比赛”等概念,其在图像中的实例更多由共同的时空与语义结构而非底层视觉相似性相联系。给定查询情境描述,我们的架构(称为 Situate)学习捕捉期望对象的视觉特征以及对象间期望空间关系的模型。对于新图像,Situate 通过这些模型以主动搜索过程尝试在图像中定位(即创建边界框)情境的各个期望组分。Situate 利用所得定位计算分数,表明新图像被认为包含该情境实例的程度。此类分数可用于在检索系统中对图像集合排序。在此初步研究中,我们将 Situate 的性能与两种基线方法以及一种基于“场景图”的相关语义图像检索系统比较,以展示该系统的潜力。

关键词

引用

@article{arxiv.1711.00088,
  title  = {Semantic Image Retrieval via Active Grounding of Visual Situations},
  author = {Max H. Quinn and Erik Conser and Jordan M. Witte and Melanie Mitchell},
  journal= {arXiv preprint arXiv:1711.00088},
  year   = {2017}
}