HOSE-Net:用于场景图生成的高阶结构嵌入网络
计算机视觉与模式识别
2020-08-13 v1
摘要
场景图生成旨在为图像生成结构化表示,这需要理解物体间的关系。由于深度神经网络的连续性,场景图的预测被划分为目标检测与关系分类。然而,独立的关系类别不能很好地区分视觉特征。尽管一些方法将视觉特征组织为图结构并使用消息传递学习上下文信息,它们仍受严重的类内差异与不平衡数据分布影响。一个重要因素是它们学习了忽略场景图固有结构的非结构化输出空间。为此,本文提出高阶结构嵌入网络(HOSE-Net)以缓解该问题。首先,我们提出新颖的结构感知嵌入到分类器(SEC)模块,将关系的局部与全局结构信息同时纳入输出空间。具体而言,通过基于局部图的消息传递学习一组上下文嵌入,再映射到基于全局结构的分类空间。其次,由于学习过多上下文特定分类子空间会遭遇数据稀疏问题,我们提出层次语义聚合(HSA)模块,通过引入高阶结构信息减少子空间数量。HSA 也是基于关系知识图自动搜索语义物体层次的快速灵活工具。大量实验表明,所提 HOSE-Net 在 Visual Genome 与 VRD 两个流行基准上取得了最先进性能。
引用
@article{arxiv.2008.05156,
title = {HOSE-Net: Higher Order Structure Embedded Network for Scene Graph Generation},
author = {Meng Wei and Chun Yuan and Xiaoyu Yue and Kuo Zhong},
journal= {arXiv preprint arXiv:2008.05156},
year = {2020}
}
备注
Accepted to ACM MM 2020