中文

关系正则化的场景图生成

计算机视觉与模式识别 2022-02-23 v1

摘要

场景图生成(SGG)构建于检测到的物体之上,以预测物体两两之间的视觉关系,从而描述图像内容的抽象。已有工作表明,若将物体间的链接作为先验知识给出,SGG 性能会显著提升。受此观察启发,本文提出一种关系正则化网络(R2-Net),其能预测两物体间是否存在关系,并将该关系编码进物体特征精炼与更好的 SGG 中。具体而言,我们首先在检测到的物体间构建亲和度矩阵以表示两物体间存在关系的概率。随后,在该关系亲和度矩阵上使用图卷积网络(GCNs)作为物体编码器,生成关系正则化的物体表示。借助这些关系正则化特征,我们的 R2-Net 能有效精炼物体标签并生成场景图。在 visual genome 数据集上针对三项 SGG 任务(即谓词分类、场景图分类与场景图检测)进行了充分实验,证明了所提方法的有效性。消融研究也验证了我们所提组件在性能提升中的关键作用。

关键词

引用

@article{arxiv.2202.10826,
  title  = {Relation Regularized Scene Graph Generation},
  author = {Yuyu Guo and Lianli Gao and Jingkuan Song and Peng Wang and Nicu Sebe and Heng Tao Shen and Xuelong Li},
  journal= {arXiv preprint arXiv:2202.10826},
  year   = {2022}
}