用于视觉关系预测的张量组合网络
计算机视觉与模式识别
2022-02-10 v2
摘要
我们提出一种新颖的张量组合网络(TCN)来预测图像中的视觉关系。视觉关系预测(VRP)比传统的图像标注提供了更具挑战性的图像理解测试,并且由于庞大的标签空间和标注不完整而难以学习。我们 TCN 的关键思想是利用视觉关系张量的低秩性质,从而借助物体与关系内部及之间的相关性,对图像中所有视觉关系进行结构化预测。为展示模型的有效性,我们首先将我们的模型与多标签图像分类(MLIC)方法、极端多标签分类(XMC)方法和 VRD 方法进行经验比较。然后我们展示,得益于我们的张量(解)组合层,我们的模型能够预测训练数据集中未出现过的视觉关系。最后我们展示,我们的 TCN 的图像级视觉关系预测提供了一种简单高效的基于关系的图像检索机制,即使与 VRD 方法相比也是如此。
引用
@article{arxiv.2012.05473,
title = {Tensor Composition Net for Visual Relationship Prediction},
author = {Yuting Qiang and Yongxin Yang and Xueting Zhang and Yanwen Guo and Timothy M. Hospedales},
journal= {arXiv preprint arXiv:2012.05473},
year = {2022}
}