中文

AMMUNet:用于遥感图像分割的多尺度注意力图合并

计算机视觉与模式识别 2024-04-23 v1

摘要

深度学习的发展推动了遥感语义分割取得显著进展。虽然注意力机制使全局建模成为可能并利用上下文信息,但面临高计算成本问题,需采用基于窗口的操作,这削弱了对长程依赖关系的捕获,限制了其在遥感图像处理中的效果。本文提出 AMMUNet,一个基于 UNet 的框架,采用多尺度注意力图合并技术,包含两个关键创新:粒度多头自注意力 (GMSA) 模块和注意力图合并机制 (AMMM)。GMSA 通过战略利用维度对应性对齐粒度,减少相对位置偏置参数,从而在计算效率方面显著缓解了与全局多头自注意力机制相比的计算成本。所提出的 AMMM 有效地将多尺度注意力图整合为统一表示,采用固定掩码模板,使其能够建模全局注意力机制。实验评估表明,我们的方法在具有挑战性的 Vaihingen 数据集上实现了 75.48% 的平均交并比 (mIoU) 得分,在 Potsdam 数据集上取得了卓越的 77.90%,显示出在精准遥感语义分割方面的优越性。代码已公开于 https://github.com/interpretty/AMMUNet。

关键词

引用

@article{arxiv.2404.13408,
  title  = {AMMUNet: Multi-Scale Attention Map Merging for Remote Sensing Image Segmentation},
  author = {Yang Yang and Shunyi Zheng},
  journal= {arXiv preprint arXiv:2404.13408},
  year   = {2024}
}