基于解释的图网络弱监督视觉关系学习
计算机视觉与模式识别
2020-07-21 v2
摘要
视觉关系检测对于整体图像理解至关重要。然而,(主体, 谓词, 客体)三元组的定位与分类仍是具有挑战性的任务,原因在于可能关系的组合爆炸、其在自然图像中的长尾分布以及昂贵的标注过程。本文提出了一种新颖的弱监督视觉关系检测方法,其仅依赖极少的图像级谓词标签。一个图神经网络被训练用于从已检测对象的图表示中分类图像中的谓词,隐式编码了成对关系的归纳偏置。随后,我们将关系检测框定为该谓词分类器的解释,即通过恢复预测谓词的主体与客体来获得完整关系。我们在三个多样且具挑战性的数据集上展示了与近期全监督及弱监督方法相当的结果:用于人-物交互的HICO-DET、用于通用对象间关系的Visual Relationship Detection,以及用于异常三元组的UnRel;证明了其对非完备标注的鲁棒性与良好的少样本泛化能力。
引用
@article{arxiv.2006.09562,
title = {Explanation-based Weakly-supervised Learning of Visual Relations with Graph Networks},
author = {Federico Baldassarre and Kevin Smith and Josephine Sullivan and Hossein Azizpour},
journal= {arXiv preprint arXiv:2006.09562},
year = {2020}
}
备注
Published at the European Conference on Computer Vision, ECCV 2020 (Poster)