Sigma:用于多模态语义分割的 Siamese Mamba 网络
计算机视觉与模式识别
2025-09-11 v3
摘要
多模态语义分割显著增强了 AI 智能体的感知与场景理解能力,尤其是在低光照或过曝等不利条件下。利用热成像和深度等附加模态(X-modality)以及传统 RGB,可提供互补信息,从而实现更鲁棒、更可靠的预测。在本工作中,我们引入了 Sigma,一种利用先进的 Mamba 进行多模态语义分割的 Siamese Mamba 网络。传统方法依赖 CNN,其局部感受野有限;或依赖 Vision Transformer (ViT),其以平方复杂度为代价提供全局感受野;而我们的模型以线性复杂度实现了全局感受野。通过采用 Siamese 编码器并创新基于 Mamba 的融合机制,我们有效地从不同模态中选择关键信息。随后开发了一个解码器以增强模型的通道级建模能力。我们提出的方法在 RGB-Thermal 和 RGB-Depth 语义分割任务上均进行了严格评估,证明了其优越性,并标志着 State Space Model (SSM) 在多模态感知任务中的首次成功应用。代码可在 https://github.com/zifuwan/Sigma 获取。
引用
@article{arxiv.2404.04256,
title = {Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation},
author = {Zifu Wan and Pingping Zhang and Yuhao Wang and Silong Yong and Simon Stepputtis and Katia Sycara and Yaqi Xie},
journal= {arXiv preprint arXiv:2404.04256},
year = {2025}
}
备注
Accepted by WACV 2025. Project page: https://zifuwan.github.io/Sigma/