中文

利用类比检测未见视觉关系

计算机视觉与模式识别 2019-09-24 v3

摘要

我们致力于检测图像中形如三元组t = (主体, 谓词, 客体)的视觉关系,例如“人骑狗”,其中各独立实体的训练样本可得,但其组合在训练时未见。由于视觉关系的组合性本质,这是一个重要的设定:为所有可能三元组收集充足训练数据将极为困难。本工作的贡献有三方面。首先,我们学习一种视觉关系表示,其结合(i)主体、客体和谓词的独立嵌入,以及(ii)表示关系三元组的视觉短语嵌入。其次,我们学习如何利用涉及相似客体的关系之间的类比,将视觉短语嵌入从已有训练三元组迁移至未见测试三元组。第三,我们在三个具有挑战性的数据集上展示我们方法的优势:在HICO-DET上,我们的模型在频繁与未见三元组上均相较强基线取得显著提升;在COCO-a数据集上,我们对具有词汇外谓词的未见三元组检索观察到类似提升,在UnRel数据集中具有挑战性的不寻常三元组上亦如此。

关键词

引用

@article{arxiv.1812.05736,
  title  = {Detecting unseen visual relations using analogies},
  author = {Julia Peyre and Ivan Laptev and Cordelia Schmid and Josef Sivic},
  journal= {arXiv preprint arXiv:1812.05736},
  year   = {2019}
}