中文

基于变分上下文的图像中指代表达定位

计算机视觉与模式识别 2019-07-03 v2

摘要

我们关注图像中指代表达的定位(即局部化或关联),例如“站在小象身后最大的大象”。这是一项通用但极具挑战的视觉-语言任务,因为它不仅要求物体的定位,还要求对上下文的多模态理解——视觉属性(如“最大的”、“小”)和关系(如“身后”),这些有助于将指称对象与其他物体(尤其是同类别物体)区分开。由于建模与多个图像区域相关联的上下文涉及指数级复杂度,现有工作通过多示例学习将该任务过度简化为成对区域建模。本文中,我们提出一种称为变分上下文(Variational Context)的变分贝叶斯方法来解决指代表达定位中的复杂上下文建模问题。我们的模型利用了指称对象与上下文之间的互反关系,即二者中任一方都会影响另一方后验分布的估计,从而可大幅缩减上下文的搜索空间,实现更好的指称定位。我们开发了新颖的线索特定语言-视觉嵌入网络,端到端地学习该互反模型。我们还将模型扩展到无监督设定,即无可用指称标注的情况。在多个基准上的大量实验表明,在有监督与无监督设定下均较 SOTA 方法取得一致提升。

关键词

引用

@article{arxiv.1712.01892,
  title  = {Grounding Referring Expressions in Images by Variational Context},
  author = {Hanwang Zhang and Yulei Niu and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1712.01892},
  year   = {2019}
}

备注

in 2018 Conference on Computer Vision and Pattern Recognition (CVPR'18)