中文

U-MixFormer:用于高效语义分割的基于Mix-Attention的类UNet Transformer

计算机视觉与模式识别 2023-12-12 v1

摘要

随着Transformer架构的采用,语义分割取得了显著进展。与Transformer取得的 strides 并行,基于CNN的U-Net也取得了重大进展,尤其是在高分辨率医学成像和遥感领域。这种双重成功启发我们将两者的优势结合起来,从而促成了一个专为高效上下文编码定制的基于U-Net的视觉Transformer解码器的诞生。在此,我们提出了一种构建于U-Net结构之上的新型Transformer解码器U-MixFormer,专为高效语义分割而设计。我们的方法有别于以往的Transformer方法,除了传统依赖跳跃连接外,还利用编码器和解码器阶段之间的横向连接作为注意力模块的特征查询。此外,我们创新地将来自不同编码器和解码器阶段的分层特征图混合,形成键和值的统一表示,从而产生了我们独特的混合注意力模块。我们的方法在各种配置下均展现出SOTA性能。大量实验表明,U-MixFormer以大幅优势优于SegFormer、FeedFormer和SegNeXt。例如,在ADE20K上,U-MixFormer-B0以高出3.8%和2.0%的mIoU以及减少27.3%和21.8%的计算量超越了SegFormer-B0和FeedFormer-B0,并在使用MSCAN-T编码器时以高出3.3%的mIoU优于SegNeXt。代码可在 https://github.com/julian-klitzing/u-mixformer 获取。

关键词

引用

@article{arxiv.2312.06272,
  title  = {U-MixFormer: UNet-like Transformer with Mix-Attention for Efficient Semantic Segmentation},
  author = {Seul-Ki Yeom and Julian von Klitzing},
  journal= {arXiv preprint arXiv:2312.06272},
  year   = {2023}
}

备注

8 Pages, 6 Tables, 6 Figures