中文

用于视觉关系检测的定尺寸目标编码

计算机视觉与模式识别 2020-06-01 v1

摘要

在本文中,我们提出了一种定尺寸目标编码方法(FOE-VRD),以提升视觉关系检测任务的性能。与以往方法相比,FOE-VRD具有一个重要特征,即它使用一个定尺寸向量对每幅输入图像中的所有目标进行编码,以辅助关系检测过程。首先,我们使用常规卷积神经网络作为特征提取器,生成输入图像的高级特征。然后,对于输入图像中的每个关系三元组,即 <<subject-predicate-object>>,我们应用ROI-pooling在特征图上获取对应于主体与目标边界框的两个区域的特征向量。除主体与目标外,我们的分析表明,谓词分类的结果也可能与输入图像中的其余目标(我们称之为背景目标)相关。由于不同图像中背景目标的数量可变且存在计算开销,我们无法使用ROI池化技术逐一为它们生成特征向量。相反,我们提出了一种新方法,使用一个定尺寸向量(即FBE向量)对每幅图像中的所有背景目标进行编码。通过拼接上述生成的3个向量,我们成功使用一个定尺寸向量对目标进行了编码。生成的特征向量随后被输入全连接神经网络以获取谓词分类结果。在VRD数据库(全集与零样本测试)上的实验结果表明,所提方法在谓词分类与关系检测上均表现良好。

关键词

引用

@article{arxiv.2005.14600,
  title  = {Fixed-size Objects Encoding for Visual Relationship Detection},
  author = {Hengyue Pan and Xin Niu and Rongchun Li and Siqi Shen and Yong Dou},
  journal= {arXiv preprint arXiv:2005.14600},
  year   = {2020}
}

备注

14 pages