中文

L-MCAT:用于无配对多模态卫星图像标签高效分类的对比注意力转换器

计算机视觉与模式识别 2025-07-29 v1

摘要

我们提出了轻量级多模态对比注意力转换器(L-MCAT),这是一种新型基于转换器的框架,用于从无配对多模态卫星遥感图像中实现标签高效遥感图像分类。L-MCAT 引入了两个核心创新:(1) 模态-光谱适配器(MSA),将高维传感器输入压缩到统一的嵌入空间中;(2) 无配对多模态注意力对齐(U-MAA),一种集成到注意力层中的对比自监督机制,用于在无像素级对应关系或标签的情况下对异构模态进行对齐。L-MCAT 在仅使用每类 20 个标签的情况下即可在 SEN12MS 数据集上实现 95.4% 的总体准确率,超越了采用对比学习基线的方法,同时使用的参数数量是 MCTrans 的 47 倍,计算复杂度(FLOPs)仅为其的 23 倍。即使在 50% 空间错位的情况下,L-MCAT 也能保持超过 92% 的准确率,显示其对实际部署具有很强的鲁棒性。该模型可以在单个消费级 GPU 上在 5 小时内完成端到端训练。

关键词

引用

@article{arxiv.2507.20259,
  title  = {L-MCAT: Unpaired Multimodal Transformer with Contrastive Attention for Label-Efficient Satellite Image Classification},
  author = {Mitul Goswami and Mrinal Goswami},
  journal= {arXiv preprint arXiv:2507.20259},
  year   = {2025}
}