用于语义分割的低分辨率自注意力
计算机视觉与模式识别
2025-06-17 v3
摘要
语义分割任务天然需要高分辨率信息以进行像素级分割,以及全局上下文信息以进行类别预测。尽管现有视觉Transformer展现出前景良好的性能,它们常利用高分辨率上下文建模,导致计算瓶颈。在本工作中,我们挑战传统认知,引入低分辨率自注意力(LRSA)机制,以显著降低的计算成本(即FLOPs)捕获全局上下文。我们的方法是在固定的低分辨率空间中计算自注意力,而不论输入图像的分辨率如何,并辅以额外的3x3深度可分离卷积在高分辨率空间中捕获精细细节。我们通过构建LRFormer(一种具有编码器-解码器结构的视觉Transformer)证明了LRSA方法的有效性。在ADE20K、COCO-Stuff和Cityscapes数据集上的大量实验表明,LRFormer优于最先进的模型。代码见 https://github.com/yuhuan-wu/LRFormer。
引用
@article{arxiv.2310.05026,
title = {Low-Resolution Self-Attention for Semantic Segmentation},
author = {Yu-Huan Wu and Shi-Chen Zhang and Yun Liu and Le Zhang and Xin Zhan and Daquan Zhou and Jiashi Feng and Ming-Ming Cheng and Liangli Zhen},
journal= {arXiv preprint arXiv:2310.05026},
year = {2025}
}
备注
Accepted by IEEE TPAMI; 14 pages, 6 figures, 14 tables