中文

变分上下文:利用视觉与文本上下文定位指代表达式

计算机视觉与模式识别 2019-07-09 v1

摘要

我们关注图像中指代表达式的定位(即定位或关联),例如“站在小象身后最大的大象”。这是一项通用却具挑战性的视觉-语言任务,因为它不仅要求目标定位,还要求对上下文进行多模态理解——视觉属性(如“最大的”、“小”)和关系(如“身后”)有助于将指称对象与其他对象尤其是同类对象区分开。由于建模与多个图像区域相关上下文所涉及的指数量级复杂度,现有工作通过多示例学习将此任务过度简化为成对区域建模。在本文中,我们提出一种称为变分上下文的变分贝叶斯方法来解决指代表达式定位中的复杂上下文建模问题。具体而言,我们的框架利用指称对象与上下文之间的互易关系,即二者中任一方影响另一方后验分布的估计,从而可大幅缩减上下文的搜索空间。除互易性外,我们的框架还考虑上下文的语义信息,即基于估计的上下文可重构指代表达式。我们还将模型扩展到无监督设定,其中无可用的指称对象标注。在各种基准上的大量实验表明,在有监督和无监督设定下均相对于 SOTA 方法取得一致提升。

关键词

引用

@article{arxiv.1907.03609,
  title  = {Variational Context: Exploiting Visual and Textual Context for Grounding Referring Expressions},
  author = {Yulei Niu and Hanwang Zhang and Zhiwu Lu and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:1907.03609},
  year   = {2019}
}

备注

Accepted as regular paper in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Substantial text overlap with arXiv:1712.01892