中文

FsaNet:用于语义分割的频率自注意力机制

计算机视觉与模式识别 2023-07-27 v3 人工智能

摘要

考虑到图像的频谱特性,我们提出了一种新的自注意力机制,其计算复杂度大幅降低,可达线性速率。为了更好地保留边缘同时促进对象内部的相似性,我们提出了针对不同频带的个性化处理。特别地,我们研究了一种仅在低频分量上进行处理的情况。通过消融研究,我们表明低频自注意力即使在不重新训练网络的情况下,也能达到与全频率非常接近或更好的性能。据此,我们设计并将新颖的即插即用模块嵌入到 CNN 网络的头部,我们称之为 FsaNet。频率自注意力 1) 仅需少量低频系数作为输入,2) 在数学上可等价于具有线性结构的空间域自注意力,3) 同时简化了令牌映射(1x1 卷积)阶段和令牌混合阶段。我们证明,与常规自注意力相比,频率自注意力所需内存减少 87.29% ~ 90.04%,FLOPs 减少 96.13% ~ 98.07%,运行时间减少 97.56% ~ 98.18%。与其他基于 ResNet101 的自注意力网络相比,FsaNet 在 Cityscape 测试数据集上取得了新的 SOTA 结果(83.0% mIoU),并在 ADE20k 和 VOCaug 上取得了有竞争力的结果。FsaNet 还可以增强 MASK R-CNN 在 COCO 上的实例分割性能。此外,利用所提出的模块,Segformer 在一系列不同尺度的模型上都能得到提升,并且 Segformer-B5 甚至可以在不重新训练的情况下得到改进。代码可在 \url{https://github.com/zfy-csu/FsaNet} 获取。

关键词

引用

@article{arxiv.2211.15595,
  title  = {FsaNet: Frequency Self-attention for Semantic Segmentation},
  author = {Fengyu Zhang and Ashkan Panahi and Guangjun Gao},
  journal= {arXiv preprint arXiv:2211.15595},
  year   = {2023}
}