中文

全景分割 SegFormer:利用 Transformer 更深入地研究全景分割

计算机视觉与模式识别 2022-03-21 v4

摘要

全景分割涉及语义分割和实例分割的联合,其中图像内容被分为两类:物体和背景。我们提出了 Panoptic SegFormer,这是一个基于 Transformer 的全景分割通用框架。它包含三个创新组件:一个高效的深度监督掩码解码器、一个查询解耦策略以及一个改进的后处理方法。我们还使用 Deformable DETR 来高效处理多尺度特征,它是 DETR 的一个快速高效版本。具体来说,我们以逐层的方式监督掩码解码器中的注意力模块。这种深度监督策略使注意力模块能够快速聚焦于有意义的语义区域。与 Deformable DETR 相比,它提高了性能并将所需的训练轮数减少了一半。我们的查询解耦策略解耦了查询集的职责,避免了前景和背景之间的相互干扰。此外,我们的后处理策略通过联合考虑分类和分割质量来解决冲突的掩码重叠,从而在不增加额外成本的情况下提高了性能。我们的方法在基线 DETR 模型上将准确率提高了 6.2% PQ。Panoptic SegFormer 在 COCO test-dev 上以 56.2% PQ 达到了最先进的结果。它还显示出比现有方法更强的零样本鲁棒性。代码已发布在 \url{https://github.com/zhiqi-li/Panoptic-SegFormer}。

关键词

引用

@article{arxiv.2109.03814,
  title  = {Panoptic SegFormer: Delving Deeper into Panoptic Segmentation with Transformers},
  author = {Zhiqi Li and Wenhai Wang and Enze Xie and Zhiding Yu and Anima Anandkumar and Jose M. Alvarez and Ping Luo and Tong Lu},
  journal= {arXiv preprint arXiv:2109.03814},
  year   = {2022}
}

备注

Accepted to CVPR 2022