SegViTv2:基于普通视觉Transformer探索高效且持续性的语义分割
计算机视觉与模式识别
2023-08-31 v2
摘要
本文在编码器-解码器框架下研究普通视觉Transformer(ViT)的语义分割能力,并引入\textbf{SegViTv2}。在本研究中,我们提出一种新颖的注意力到掩码(\atm)模块以设计对普通ViT有效的轻量解码器。所提ATM将全局注意力图转换为语义掩码以获得高质量分割结果。我们的解码器在使用多种ViT骨干时优于流行的解码器UPerNet,而仅消耗约的计算成本。对于编码器,我们针对基于ViT的编码器计算成本相对较高的担忧,提出\emph{Shrunk++}结构,其融合了边缘感知的基于查询的下采样(EQD)与基于查询的上采样(QU)模块。Shrunk++结构将编码器的计算成本降低多达同时保持有竞争力的性能。此外,我们提出将SegViT应用于持续语义分割,展现出对先前学习知识的近乎零遗忘。实验表明,我们提出的SegViTv2在ADE20k、COCO-Stuff-10k和PASCAL-Context三个流行基准上超越了近期分割方法。代码可通过以下链接获取:\url{https://github.com/zbwxp/SegVit}。
引用
@article{arxiv.2306.06289,
title = {SegViTv2: Exploring Efficient and Continual Semantic Segmentation with Plain Vision Transformers},
author = {Bowen Zhang and Liyang Liu and Minh Hieu Phan and Zhi Tian and Chunhua Shen and Yifan Liu},
journal= {arXiv preprint arXiv:2306.06289},
year = {2023}
}
备注
IJCV 2023 accepted, 21 pages, 8 figures, 12 tables