中文

Zoom-Net:挖掘深度特征交互用于视觉关系识别

计算机视觉与模式识别 2018-07-16 v1

摘要

识别任意一对定位对象之间的视觉关系 <主体-谓词-对象> 对图像理解至关重要。先前的研究在利用语言先验或外部文本信息以提升性能方面取得了显著进展。在本工作中,我们研究基于特征交互的正交视角。我们表明,通过促进局部对象特征与全局谓词特征之间的深度消息传播与交互,可以在不使用任何语言先验的情况下实现识别复杂关系的优异性能。为此,我们提出两种新的池化单元以促进特征交互:(i)对比 ROI 池化单元,其具有独特的 deROI 池化,将局部对象特征反向池化到全局谓词特征的对应区域;(ii)金字塔 ROI 池化单元,其广播全局谓词特征以增强局部对象特征。这两个单元构成空间性-上下文-表观模块(SCA-M),可进一步连续堆叠形成我们最终的 Zoom-Net。我们进一步阐明了如何通过类内层次树(IH-tree)解决模糊和噪声的对象与谓词标注。在 Visual Genome 数据集上进行的大量实验证明了我们的面向特征方法相较于依赖显式语言交互建模的当前最优方法(Acc@1 从 8.16% 提升至 11.42%)的有效性。我们进一步表明,SCA-M 可无缝集成到现有方法中,大幅提升性能。源代码将发布于 https://github.com/gjyin91/ZoomNet。

关键词

引用

@article{arxiv.1807.04979,
  title  = {Zoom-Net: Mining Deep Feature Interactions for Visual Relationship Recognition},
  author = {Guojun Yin and Lu Sheng and Bin Liu and Nenghai Yu and Xiaogang Wang and Jing Shao and Chen Change Loy},
  journal= {arXiv preprint arXiv:1807.04979},
  year   = {2018}
}

备注

22 pages, 9 figures, accepted by ECCV 2018, the source code will be released on https://github.com/gjyin91/ZoomNet