RS3Mamba:面向遥感图像语义分割的视觉状态空间模型
计算机视觉与模式识别
2024-04-04 v1
摘要
遥感图像语义分割是地球科学研究中的一项基本任务。然而,广泛使用的卷积神经网络(CNN)和Transformer在这方面存在显著局限。前者受限于其对长程建模能力的不足,而后者则受其计算复杂度的制约。最近,一种以Mamba为代表的新型视觉状态空间(VSS)模型涌现出来,能够以线性计算复杂度来建模长程关系。在本工作中,我们提出了一种名为遥感图像语义分割Mamba(RS3Mamba)的新型双分支网络,以将这一创新技术引入遥感任务。具体而言,RS3Mamba利用VSS块构建一个辅助分支,为基于卷积的主分支提供额外的全局信息。此外,考虑到两个分支的独特特征,我们引入了一种协同完成模块(CCM)来增强和融合来自双编码器的特征。在两个广泛使用的基准数据集ISPRS Vaihingen和LoveDA Urban上的实验结果表明,所提出的RS3Mamba有效且具有潜力。迄今为止,已知是首个为遥感图像语义分割专门设计的视觉Mamba。源代码将在https://github.com/sstary/SSRS上公开。
引用
@article{arxiv.2404.02457,
title = {RS3Mamba: Visual State Space Model for Remote Sensing Images Semantic Segmentation},
author = {Xianping Ma and Xiaokang Zhang and Man-On Pun},
journal= {arXiv preprint arXiv:2404.02457},
year = {2024}
}
备注
5 pages, 4 figures