中文

Lawin Transformer:通过大窗口注意力以多尺度表示改进语义分割Transformer

计算机视觉与模式识别 2023-08-10 v4

摘要

多尺度表示对语义分割至关重要。学界已见证利用多尺度上下文信息的语义分割卷积神经网络(CNN)的蓬勃发展。受视觉Transformer(ViT)在图像分类中表现强大的启发,近期提出了一些语义分割ViT,其中大多数取得了令人印象深刻的成果,但牺牲了计算经济性。本文中,我们成功通过窗口注意力机制将多尺度表示引入语义分割ViT,并进一步提升了性能与效率。为此,我们引入大窗口注意力,仅以极少的计算开销允许局部窗口查询更大范围的上下文窗口。通过调节上下文区域与查询区域的比例,我们使大窗口注意力能够捕获多尺度的上下文信息。此外,采用空间金字塔池化框架与大窗口注意力协作,提出了一种名为大窗口注意力空间金字塔池化(LawinASPP)的新型解码器用于语义分割ViT。我们最终的ViT,即Lawin Transformer,由高效的分层视觉Transformer(HVT)作为编码器与LawinASPP作为解码器组成。实证结果表明,与现有方法相比,Lawin Transformer提供了改进的效率。Lawin Transformer进一步在Cityscapes(84.4% mIoU)、ADE20K(56.2% mIoU)和COCO-Stuff数据集上确立了新的SOTA性能。代码将发布于 https://github.com/yan-hao-tian/lawin

关键词

引用

@article{arxiv.2201.01615,
  title  = {Lawin Transformer: Improving Semantic Segmentation Transformer with Multi-Scale Representations via Large Window Attention},
  author = {Haotian Yan and Chuang Zhang and Ming Wu},
  journal= {arXiv preprint arXiv:2201.01615},
  year   = {2023}
}