基于普通视觉Transformer的极简高性能语义分割
计算机视觉与模式识别
2023-10-20 v1
摘要
在掩码图像建模(Masked Image Modeling, MIM)兴起之后,多种普通的、非层级的视觉Transformer(ViT)模型已在大规模数据集上完成预训练,为语义分割提供了新的范式与重要潜力。当前最先进的系统引入了大量归纳偏置并采用繁琐的解码器。基于普通ViT原本追求简洁与通用的动机,我们为此探索高性能的“极简”系统。我们的主要目的是为基于普通ViT的实际语义分割提供简单高效的基线。具体而言,我们首先探讨了利用最后一张特征图实现高性能语义分割的可行性与方法。据此,我们提出了PlainSeg,该模型除Transformer层(编码器或解码器)外仅包含三个3×3卷积。在此过程中,我们揭示了两条潜在原则:(i)尽管采用简单的上采样技术,高分辨率特征对高性能至关重要;(ii)窄而深的Transformer解码器所需学习率远大于宽而浅的Transformer解码器。在此基础上,我们进一步提出PlainSeg-Hier,其允许利用层级特征。在四个流行基准上的大量实验证明了我们方法的高性能与高效率。它们也可作为评估语义分割中基模型迁移能力的强力工具。代码见https://github.com/ydhongHIT/PlainSeg。
引用
@article{arxiv.2310.12755,
title = {Minimalist and High-Performance Semantic Segmentation with Plain Vision Transformers},
author = {Yuanduo Hong and Jue Wang and Weichao Sun and Huihui Pan},
journal= {arXiv preprint arXiv:2310.12755},
year = {2023}
}