中文

在遥感图像语义分割中重新思考 Vision Mamba 的扫描策略:一项实验研究

计算机视觉与模式识别 2024-10-29 v1

摘要

深度学习方法,尤其是 Convolutional Neural Networks (CNN) 和 Vision Transformer (ViT),常被用于对高分辨率遥感图像进行语义分割。然而,CNN 受限于其有限的感受野,而 ViT 则面临二次复杂度的挑战。最近,具有线性复杂度和全局感受野的 Mamba 模型在视觉任务中引起了广泛关注。在此类任务中,图像需要被序列化以形成与 Mamba 模型兼容的序列。大量研究工作探索了序列化图像的扫描策略,旨在增强 Mamba 模型对图像的理解。然而,这些扫描策略的有效性仍不确定。在本研究中,我们对主流扫描方向及其组合对遥感图像语义分割的影响进行了全面的实验研究。通过在 LoveDA、ISPRS Potsdam 和 ISPRS Vaihingen 数据集上的大量实验,我们证明没有任何一种单一扫描策略能超越其他策略,无论其复杂度或扫描方向的数量如何。对于高分辨率遥感图像的语义分割,简单的单一扫描方向即被认为是足够的。还推荐了未来研究的相关方向。

关键词

引用

@article{arxiv.2405.08493,
  title  = {Rethinking Scanning Strategies with Vision Mamba in Semantic Segmentation of Remote Sensing Imagery: An Experimental Study},
  author = {Qinfeng Zhu and Yuan Fang and Yuanzhi Cai and Cheng Chen and Lei Fan},
  journal= {arXiv preprint arXiv:2405.08493},
  year   = {2024}
}