中文

利用语言先验进行视觉关系检测

计算机视觉与模式识别 2016-08-02 v1

摘要

视觉关系捕捉了图像中物体对之间各种各样的交互(例如“人骑自行车”和“人推自行车”)。因此,可能的关系集合极其庞大,难以获得涵盖所有可能关系的充足训练样本。由于这一限制,以往关于视觉关系检测的工作主要集中在预测少数几种关系。尽管大多数关系出现频率较低,但其涉及的物体(如“人”和“自行车”)和谓词(如“骑”和“推”)独立出现的频率较高。我们提出了一种模型,利用这一见解分别训练物体和谓词的视觉模型,随后将它们组合起来以预测每张图像中的多种关系。我们通过利用来自语义词嵌入的语言先验来微调预测关系的可能性,从而改进了 prior work。我们的模型能够从少量样本扩展到预测数千种类型的关系。此外,我们将预测关系中的物体定位為图像中的边界框。我们进一步证明,理解关系可以改善基于内容的图像检索。

关键词

引用

@article{arxiv.1608.00187,
  title  = {Visual Relationship Detection with Language Priors},
  author = {Cewu Lu and Ranjay Krishna and Michael Bernstein and Li Fei-Fei},
  journal= {arXiv preprint arXiv:1608.00187},
  year   = {2016}
}

备注

ECCV 2016 Oral