中文

ECCV'22 SenseHuman Workshop PSG 竞赛冠军方案

计算机视觉与模式识别 2023-02-07 v1

摘要

全景场景图(Panoptic Scene Graph, PSG)生成旨在基于全景分割而非刚性边界框生成场景图表示。现有 PSG 方法采用单阶段范式,同时生成场景图并预测语义分割掩码,或采用两阶段范式,先使用现成的全景分割器,再对这些预测对象进行两两关系预测。单阶段方法尽管训练范式简化,其分割结果通常不尽如人意;而两阶段方法缺乏全局上下文,导致关系预测性能较低。为弥补这一差距,本文提出 GRNet,一种两阶段范式下的全局关系网络(Global Relation Network),其中预提取的局部对象特征及其对应掩码被输入带有类别嵌入的 transformer 中。为处理由长尾分布引起的关系歧义与谓词分类偏置,我们将第二阶段的关係预测建模为带软标签的多分类任务。我们在 OpenPSG 数据集上进行了全面实验,并在排行榜上取得了最先进的性能。我们还在消融研究中展示了软标签策略对长尾类的有效性。我们的代码已发布于 https://github.com/wangqixun/mfpsg。

关键词

引用

@article{arxiv.2302.02651,
  title  = {1st Place Solution for PSG competition with ECCV'22 SenseHuman Workshop},
  author = {Qixun Wang and Xiaofeng Guo and Haofan Wang},
  journal= {arXiv preprint arXiv:2302.02651},
  year   = {2023}
}

备注

Tech Report