CM-UNet:用于遥感图像语义分割的混合 CNN-Mamba UNet
计算机视觉与模式识别
2024-05-20 v1
摘要
由于大规模图像尺寸和目标变异,当前基于 CNN 和基于 Transformer 的方法在捕获长程依赖或面临复杂计算复杂度方面对于遥感图像语义分割不够理想。本文提出CM-UNet,由基于 CNN 的编码器用于提取局部图像特征,和基于 Mamba 的解码器用于聚合和整合全局信息,从而高效地实现遥感图像的语义分割。具体而言,引入CS Mamba模块作为核心分割解码器,该模块利用通道注意力和空间注意力作为 vanilla Mamba 的门控激活条件,以增强特征交互和全局-局部信息融合。此外,为进一步细化来自CNN编码器的输出特征,采用多尺度注意力聚合(MSAA)模块来合并不同尺度的特征。通过集成CS Mamba模块和MSAA模块,CM-UNet有效地捕获了大规模遥感图像的长程依赖和多尺度全局上下文信息。在三个基准数据集上的实验结果表明,所提出的CM-UNet在各种性能指标上优于现有方法。代码已公开于 https://github.com/XiaoBuL/CM-UNet。
引用
@article{arxiv.2405.10530,
title = {CM-UNet: Hybrid CNN-Mamba UNet for Remote Sensing Image Semantic Segmentation},
author = {Mushui Liu and Jun Dan and Ziqian Lu and Yunlong Yu and Yingming Li and Xi Li},
journal= {arXiv preprint arXiv:2405.10530},
year = {2024}
}
备注
5 pages, 6 figures