用于平衡场景图生成的双重ResGCN
计算机视觉与模式识别
2020-11-10 v1
摘要
视觉场景图生成是一项具有挑战性的任务。以往工作已取得很大进展,但大多数未显式考虑场景图生成中的类不平衡问题。在未考虑类不平衡的情况下学习的模型倾向于预测多数类,这导致在平凡的频繁谓词上表现良好,而在信息量大的非频繁谓词上表现较差。然而,少数类的谓词往往携带更多语义和精确信息(~\textit{e.g.}, \emph{`on'} v.s \emph{`parked on'})。为缓解类不平衡的影响,我们提出一种新颖模型,称为\textit{双重ResGCN},其由物体残差图卷积网络和关系残差图卷积网络组成。两个网络互为补充。前者捕获物体级上下文信息,即物体间的连接。我们提出一种新颖的ResGCN,以交叉注意力方式增强物体特征。此外,我们堆叠多个上下文系数以缓解不平衡问题并丰富预测多样性。后者经过精心设计以显式捕获关系级上下文信息,即关系间的连接。我们提出将关于关系对共现的先验并入图中,以进一步帮助缓解类不平衡问题。在大规模数据库VG上对三项任务进行了广泛评估,以证明所提方法的优越性。
引用
@article{arxiv.2011.04234,
title = {Dual ResGCN for Balanced Scene GraphGeneration},
author = {Jingyi Zhang and Yong Zhang and Baoyuan Wu and Yanbo Fan and Fumin Shen and Heng Tao Shen},
journal= {arXiv preprint arXiv:2011.04234},
year = {2020}
}