中文

SegViTv2:基于普通视觉Transformer探索高效且持续性的语义分割

计算机视觉与模式识别 2023-08-31 v2

摘要

本文在编码器-解码器框架下研究普通视觉Transformer(ViT)的语义分割能力,并引入\textbf{SegViTv2}。在本研究中,我们提出一种新颖的注意力到掩码(\atm)模块以设计对普通ViT有效的轻量解码器。所提ATM将全局注意力图转换为语义掩码以获得高质量分割结果。我们的解码器在使用多种ViT骨干时优于流行的解码器UPerNet,而仅消耗约5%5\%的计算成本。对于编码器,我们针对基于ViT的编码器计算成本相对较高的担忧,提出\emph{Shrunk++}结构,其融合了边缘感知的基于查询的下采样(EQD)与基于查询的上采样(QU)模块。Shrunk++结构将编码器的计算成本降低多达50%50\%同时保持有竞争力的性能。此外,我们提出将SegViT应用于持续语义分割,展现出对先前学习知识的近乎零遗忘。实验表明,我们提出的SegViTv2在ADE20k、COCO-Stuff-10k和PASCAL-Context三个流行基准上超越了近期分割方法。代码可通过以下链接获取:\url{https://github.com/zbwxp/SegVit}。

关键词

引用

@article{arxiv.2306.06289,
  title  = {SegViTv2: Exploring Efficient and Continual Semantic Segmentation with Plain Vision Transformers},
  author = {Bowen Zhang and Liyang Liu and Minh Hieu Phan and Zhi Tian and Chunhua Shen and Yifan Liu},
  journal= {arXiv preprint arXiv:2306.06289},
  year   = {2023}
}

备注

IJCV 2023 accepted, 21 pages, 8 figures, 12 tables