中文

用于语义分割的低分辨率自注意力

计算机视觉与模式识别 2025-06-17 v3

摘要

语义分割任务天然需要高分辨率信息以进行像素级分割,以及全局上下文信息以进行类别预测。尽管现有视觉Transformer展现出前景良好的性能,它们常利用高分辨率上下文建模,导致计算瓶颈。在本工作中,我们挑战传统认知,引入低分辨率自注意力(LRSA)机制,以显著降低的计算成本(即FLOPs)捕获全局上下文。我们的方法是在固定的低分辨率空间中计算自注意力,而不论输入图像的分辨率如何,并辅以额外的3x3深度可分离卷积在高分辨率空间中捕获精细细节。我们通过构建LRFormer(一种具有编码器-解码器结构的视觉Transformer)证明了LRSA方法的有效性。在ADE20K、COCO-Stuff和Cityscapes数据集上的大量实验表明,LRFormer优于最先进的模型。代码见 https://github.com/yuhuan-wu/LRFormer。

关键词

引用

@article{arxiv.2310.05026,
  title  = {Low-Resolution Self-Attention for Semantic Segmentation},
  author = {Yu-Huan Wu and Shi-Chen Zhang and Yun Liu and Le Zhang and Xin Zhan and Daquan Zhou and Jiashi Feng and Ming-Ming Cheng and Liangli Zhen},
  journal= {arXiv preprint arXiv:2310.05026},
  year   = {2025}
}

备注

Accepted by IEEE TPAMI; 14 pages, 6 figures, 14 tables