Panoptic-PartFormer:学习一种用于全景部件分割的统一模型
计算机视觉与模式识别
2022-07-12 v2
摘要
全景部件分割(PPS)旨在将全景分割与部件分割统一为一项任务。以往工作主要采用分离的方法分别处理 thing、stuff 和部件预测,而不进行任何共享计算与任务关联。本工作中,我们旨在在架构层面统一这些任务,设计了首个端到端统一方法 Panoptic-PartFormer。具体而言,受视觉 transformer 近期进展的启发,我们将 thing、stuff 和部件建模为对象查询,并直接学习将这三类预测作为统一的掩码预测与分类问题进行优化。我们设计了一个解耦解码器以分别生成部件特征和 thing/stuff 特征。接着我们提出利用所有查询及对应特征进行联合且迭代的推理。最终掩码可通过查询与对应特征的内积获得。大量消融实验与分析证明了我们框架的有效性。我们的 Panoptic-PartFormer 在 Cityscapes PPS 和 Pascal Context PPS 数据集上均以至少 70% GFlops 和 50% 参数量的下降取得了新的 SOTA 结果。特别地,在 Pascal Context PPS 数据集上,采用 ResNet50 骨干我们得到 3.4% 的相对提升,采用 Swin Transformer 后提升达 10%。据我们所知,我们首个通过\textit{统一端到端 transformer 模型}解决 PPS 问题。鉴于其有效性与概念简洁性,我们希望我们的 Panoptic-PartFormer 能作为良好基线并助力未来 PPS 的统一研究。我们的代码与模型见 https://github.com/lxtGH/Panoptic-PartFormer。
引用
@article{arxiv.2204.04655,
title = {Panoptic-PartFormer: Learning a Unified Model for Panoptic Part Segmentation},
author = {Xiangtai Li and Shilin Xu and Yibo Yang and Guangliang Cheng and Yunhai Tong and Dacheng Tao},
journal= {arXiv preprint arXiv:2204.04655},
year = {2022}
}
备注
ECCV-2022