中文

M³amba:CLIP 驱动的 Mamba 模型用于多模态遥感分类

计算机视觉与模式识别 2025-03-11 v1

摘要

多模态融合在整合不同模态信息方面具有巨大前景。然而,由于缺乏对模态一致性的考虑,遥感领域的现有多模态融合方法在融合设计中仍面临语义信息不完整和计算效率低下的挑战。受视觉语言预训练模型 CLIP 能够有效从视觉特征中提取强语义信息的启发,我们提出 M³amba——一种新颖的端到端 CLIP 驱动 Mamba 模型,用于多模态融合以解决这些挑战。具体而言,我们在融合架构中引入 CLIP 驱动的模态特定适配器,以避免直接推理导致的特定领域理解偏差,使原始 CLIP 编码器具备模态特定感知能力。这一统一框架能够通过最少的训练实现对不同模态的全面语义理解,从而指导跨模态特征融合。为进一步增强模态映射之间的一致关联,我们设计了具有线性复杂度的多模态 Mamba 融合架构以及交叉注意力模块 Cross-SS2D,充分考虑了有效且高效的信息交互以实现完整融合。大量实验表明,M³amba 在遥感领域多模态高光谱图像分类任务中相比最先进方法平均性能提升至少 5.98%,同时展现出优异的训练效率,在准确率和效率上均实现翻倍提升。代码发布于 https://github.com/kaka-Cao/M3amba。

关键词

引用

@article{arxiv.2503.06446,
  title  = {M$^3$amba: CLIP-driven Mamba Model for Multi-modal Remote Sensing Classification},
  author = {Mingxiang Cao and Weiying Xie and Xin Zhang and Jiaqing Zhang and Kai Jiang and Jie Lei and Yunsong Li},
  journal= {arXiv preprint arXiv:2503.06446},
  year   = {2025}
}