利用类比检测未见视觉关系
计算机视觉与模式识别
2019-09-24 v3
摘要
我们致力于检测图像中形如三元组t = (主体, 谓词, 客体)的视觉关系,例如“人骑狗”,其中各独立实体的训练样本可得,但其组合在训练时未见。由于视觉关系的组合性本质,这是一个重要的设定:为所有可能三元组收集充足训练数据将极为困难。本工作的贡献有三方面。首先,我们学习一种视觉关系表示,其结合(i)主体、客体和谓词的独立嵌入,以及(ii)表示关系三元组的视觉短语嵌入。其次,我们学习如何利用涉及相似客体的关系之间的类比,将视觉短语嵌入从已有训练三元组迁移至未见测试三元组。第三,我们在三个具有挑战性的数据集上展示我们方法的优势:在HICO-DET上,我们的模型在频繁与未见三元组上均相较强基线取得显著提升;在COCO-a数据集上,我们对具有词汇外谓词的未见三元组检索观察到类似提升,在UnRel数据集中具有挑战性的不寻常三元组上亦如此。
引用
@article{arxiv.1812.05736,
title = {Detecting unseen visual relations using analogies},
author = {Julia Peyre and Ivan Laptev and Cordelia Schmid and Josef Sivic},
journal= {arXiv preprint arXiv:1812.05736},
year = {2019}
}