中文

基于视觉 Transformer 的语义分割表示分离方法

计算机视觉与模式识别 2024-10-28 v1 人工智能

摘要

视觉 Transformer(ViTs)将图像编码为块序列,为语义分割带来了新范式。我们提出了一种在局部块级与全局区域级进行表示分离的高效框架,用于 ViTs 的语义分割。它针对 ViTs 在语义分割中特有的过平滑问题,因此不同于当前流行的上下文建模范式以及多数强化注意力优势的相关方法。我们首先给出解耦双通路网络,其中另一条通路增强并传递局部块差异,以补充 Transformer 的全局表示。随后我们提出空间自适应分离模块以获得更分离的深度表示,以及判别交叉注意力,其通过新颖的辅助监督产生更具判别性的区域表示。所提方法取得了若干令人印象深刻的成果:1)结合大规模普通 ViTs,我们的方法在五个广泛使用的基准上达到新的 SOTA 性能;2)使用掩码预训练的普通 ViTs,我们在 Pascal Context 上达到 68.9% mIoU,创下新高;3)集成解耦双通路网络的金字塔 ViTs 甚至在 Cityscapes 上超越精心设计的高分辨率 ViTs;4)我们框架改善的表示在自然腐蚀图像中具有优良的迁移性。代码将公开发布。

关键词

引用

@article{arxiv.2212.13764,
  title  = {Representation Separation for Semantic Segmentation with Vision Transformers},
  author = {Yuanduo Hong and Huihui Pan and Weichao Sun and Xinghu Yu and Huijun Gao},
  journal= {arXiv preprint arXiv:2212.13764},
  year   = {2024}
}

备注

17 pages, 13 figures. This work has been submitted to the IEEE for possible publication