中文

用于语义分割的金字塔融合 Transformer

计算机视觉与模式识别 2023-05-31 v4 人工智能

摘要

近期提出的 MaskFormer 为语义分割任务提供了新视角:它将主流的像素级分类范式转变为掩码级分类方法。本质上,它生成与类别片段对应的成对概率与掩码,并在推理时组合以得到分割图。在我们的研究中,发现基于单尺度特征的逐掩码分类解码器不足以提取可靠的概率或掩码。为挖掘特征金字塔中丰富的语义信息,我们提出一种基于 Transformer 的金字塔融合 Transformer(PFT),用于多尺度特征的逐掩码语义分割。所提 Transformer 解码器并行执行可学习查询与特征金字塔中各空间特征之间的交叉注意力,并利用跨尺度查询间注意力交换互补信息。我们在三个广泛使用的语义分割数据集上取得了有竞争力的性能。特别是在 ADE20K 验证集上,我们以 Swin-B 骨干的结果在单尺度和多尺度推理下均超越使用更大 Swin-L 骨干的 MaskFormer,分别达到 54.1 mIoU 和 55.7 mIoU。使用 Swin-L 骨干,我们取得单尺度 56.1 mIoU 和多尺度 57.4 mIoU,在该数据集上获得最先进性能。在三个广泛使用的语义分割数据集上的大量实验验证了我们所提方法的有效性。

关键词

引用

@article{arxiv.2201.04019,
  title  = {Pyramid Fusion Transformer for Semantic Segmentation},
  author = {Zipeng Qin and Jianbo Liu and Xiaolin Zhang and Maoqing Tian and Aojun Zhou and Shuai Yi and Hongsheng Li},
  journal= {arXiv preprint arXiv:2201.04019},
  year   = {2023}
}