中文

MMLGNet:使用 CLIP 的遥感数据跨模态对齐

计算机视觉与模式识别 2026-01-14 v1

摘要

在本文中,我们提出了一种新颖的多模态框架——多模态语言引导网络,利用 CLIP 等视觉-语言模型,将高光谱成像(HSI)和 LiDAR 等异构遥感模态与自然语言语义进行对齐。随着多模态地球观测数据的日益普及,对能够有效融合光谱、空间和几何信息同时实现语义级理解的方法的需求不断增长。MMLGNet 采用特定模态的编码器,并通过双向对比学习将视觉特征与手工制作的文本嵌入在共享潜在空间中对齐。受 CLIP 训练范式的启发,我们的方法弥合了高维遥感数据与语言引导解释之间的差距。值得注意的是,MMLGNet 仅凭简单的基于 CNN 的编码器便取得了强劲的性能,在两个基准数据集上优于多种现有的多模态纯视觉方法,证明了语言监督的显著优势。代码可在 https://github.com/AdityaChaudhary2913/CLIP_HSI 获取。

关键词

引用

@article{arxiv.2601.08420,
  title  = {MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP},
  author = {Aditya Chaudhary and Sneha Barman and Mainak Singha and Ankit Jha and Girish Mishra and Biplab Banerjee},
  journal= {arXiv preprint arXiv:2601.08420},
  year   = {2026}
}

备注

Accepted at InGARSS 2025