视觉关系的弱监督学习
计算机视觉与模式识别
2017-08-01 v1
摘要
本文介绍了一种新颖的方法,用于建模物体对之间的视觉关系。我们将关系称为形如(主语,谓词,宾语)的三元组,其中谓词通常是连接一对物体(主语,宾语)的介词(例如“在...之下”、“在...前面”)或动词(“拿着”、“骑着”)。学习此类关系具有挑战性,因为物体根据其所在关系的不同而具有不同的空间构型和外观。另一个主要挑战在于难以获取所有可能三元组的标注,尤其是在框级别,这使得学习和评估都很困难。本文的贡献有三方面。首先,我们设计了强大而灵活的视觉特征,用于编码物体对的外观和空间构型。其次,我们提出了一种弱监督判别聚类模型,仅从图像级标签学习关系。第三,我们引入了一个新的具有挑战性的非常规关系数据集(UnRel),并附有详尽的标注,从而能够对视觉关系检索进行精确评估。我们通过实验表明,我们的模型在视觉关系数据集上取得了最先进的结果,显著提升了在先前未见关系上的性能(零样本学习),并在我们新引入的UnRel数据集上证实了这一观察。
引用
@article{arxiv.1707.09472,
title = {Weakly-supervised learning of visual relations},
author = {Julia Peyre and Ivan Laptev and Cordelia Schmid and Josef Sivic},
journal= {arXiv preprint arXiv:1707.09472},
year = {2017}
}