中文

SegViT:基于普通视觉Transformer的语义分割

计算机视觉与模式识别 2022-12-13 v2

摘要

我们探索普通视觉Transformer(ViTs)在语义分割中的能力,并提出SegVit。以往基于ViT的分割网络通常从ViT的输出中学习像素级表征。不同地,我们利用基本组件——注意力机制,来生成语义分割的掩码。具体而言,我们提出注意力到掩码(ATM)模块,其中一组可学习的类别令牌与空间特征图之间的相似度图被转换为分割掩码。实验表明,我们提出的采用ATM模块的SegVit在ADE20K数据集上优于使用普通ViT骨干的对应方法,并在COCO-Stuff-10K与PASCAL-Context数据集上取得新的SOTA性能。此外,为降低ViT骨干的计算开销,我们提出基于查询的下采样(QD)与基于查询的上采样(QU)以构建收缩(Shrunk)结构。借助所提出的收缩结构,模型可节省多达40%40\%的计算量,同时保持有竞争力的性能。

关键词

引用

@article{arxiv.2210.05844,
  title  = {SegViT: Semantic Segmentation with Plain Vision Transformers},
  author = {Bowen Zhang and Zhi Tian and Quan Tang and Xiangxiang Chu and Xiaolin Wei and Chunhua Shen and Yifan Liu},
  journal= {arXiv preprint arXiv:2210.05844},
  year   = {2022}
}

备注

9 Pages, NeurIPS 2022