利用基于超像素的交互学习改进场景图生成
计算机视觉与模式识别
2023-08-07 v1
摘要
场景图生成(SGG)的近期进展通常利用预定义检测器得到的框级特征对实体间关系建模。我们认为 SGG 中一个被忽视的问题是框之间的粗粒度交互,其不足以捕捉用于关系建模的上下文语义,实际上限制了该领域的发展。本文率先探索并提出了一种称为基于超像素的交互学习(SIL)的通用范式,以弥补框级粗粒度交互的不足。它使我们能在 SGG 中对超像素级的细粒度交互建模。具体而言,(i)我们将场景视为一组点并将其聚类为表示场景子区域的超像素。(ii)我们探索超像素间的实体内与跨实体交互,以在更早阶段丰富实体间的细粒度交互。在两个具挑战性的基准(Visual Genome 与 Open Image V6)上的大量实验证明,我们的 SIL 实现了超越先前框级方法的超像素级细粒度交互,并在所有指标上显著优于先前最先进方法。更令人鼓舞的是,所提方法能以即插即用的方式应用于提升现有框级方法的性能。特别地,SIL 在 Visual Genome 上为 PredCls 任务的基线带来了平均 2.0% mR(甚至高达 3.4%)的提升,便于其集成到任何现有框级方法中。
引用
@article{arxiv.2308.02339,
title = {Improving Scene Graph Generation with Superpixel-Based Interaction Learning},
author = {Jingyi Wang and Can Zhang and Jinfa Huang and Botao Ren and Zhidong Deng},
journal= {arXiv preprint arXiv:2308.02339},
year = {2023}
}