语义分割中多分辨率 Transformer 的全上下文注意力
计算机视觉与模式识别
2022-12-16 v1
摘要
Transformer 已被证明对视觉识别任务非常有效。特别地,视觉 Transformer 通过自注意力和可学习的类令牌构建压缩的全局表示。多分辨率 Transformer 近期在语义分割中取得成功,但只能在高分辨率特征图中捕获局部交互。本文扩展了全局令牌的概念,构建了全局注意力多分辨率(GLAM)Transformer。GLAM 是一个通用模块,可集成到大多数现有 Transformer 骨干网络中。GLAM 包含可学习的全局令牌,与以往方法不同,其能建模所有图像区域间的交互,并在训练中提取强大的表示。大量实验表明,GLAM-Swin 或 GLAM-Swin-UNet 在 ADE20K 和 Cityscapes 上的性能显著优于其原始对应模型。此外,GLAM 可用于分割大型 3D 医学图像,且 GLAM-nnFormer 在 BCV 数据集上取得了新的最先进性能。
引用
@article{arxiv.2212.07890,
title = {Full Contextual Attention for Multi-resolution Transformers in Semantic Segmentation},
author = {Loic Themyr and Clement Rambour and Nicolas Thome and Toby Collins and Alexandre Hostettler},
journal= {arXiv preprint arXiv:2212.07890},
year = {2022}
}
备注
Winter Conference on Applications of Computer Vision (WACV 2023)