中文

先配对后关系:面向全景场景图生成的 Pair-Net

计算机视觉与模式识别 2024-08-12 v3 人工智能

摘要

全景场景图(PSG)是场景图生成(SGG)中一项具有挑战性的任务,旨在利用全景分割而非边界框来构建更全面的场景图表示。与 SGG 相比,PSG 存在若干挑战性问题:像素级分割输出与全关系探索(其同时考虑物体与背景的关系)。因此,当前 PSG 方法性能有限,阻碍了下游任务或应用。本工作的目标是为 PSG 设计一个新颖且强大的基线。为此,我们首先进行深入分析以定位当前 PSG 模型的瓶颈,发现物体间成对召回率是被以往 PSG 方法忽视的关键因素。基于此及近期的基于查询的框架,我们提出一个新框架:先配对后关系(Pair-Net),其使用配对提议网络(PPN)来学习并过滤主体与客体间的稀疏成对关系。此外,我们还观察到物体对的稀疏特性,受此启发,我们在 PPN 内设计了一个轻量级矩阵学习器,直接学习成对关系以生成配对提议。通过大量消融与分析,我们的方法相较采用分割器的坚实基线有显著提升。值得注意的是,与我们的基线 PSGFormer 相比,我们的方法取得了超过 10\% 的绝对增益。本文代码公开于 https://github.com/king159/Pair-Net。

关键词

引用

@article{arxiv.2307.08699,
  title  = {Pair then Relation: Pair-Net for Panoptic Scene Graph Generation},
  author = {Jinghao Wang and Zhengyu Wen and Xiangtai Li and Zujin Guo and Jingkang Yang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2307.08699},
  year   = {2024}
}

备注

IEEE TPAMI 2024. 13 pages. Project Page: https://github.com/king159/Pair-Net