关注模态鸿沟:通过跨模态对齐构建遥感视觉-语言模型
摘要
随着基础模型的出现,深度学习(Deep Learning, DL)正在经历范式转变。在本工作中,我们关注对比语言-图像预训练(Contrastive Language-Image Pre-training, CLIP),这是一种在各种图像分类任务中实现高精度且经常匹敌全监督基线的视觉-语言基础模型,尽管它并未针对这些任务进行显式训练。然而,仍存在一些领域其零样本 CLIP 性能远非最佳,例如遥感(Remote Sensing, RS)和医学影像。这些领域不仅展现出与自然图像根本不同的分布,而且通常依赖 RGB 之外的互补模态来获取有意义的见解。为此,我们提出了一种将不同 RS 图像模态与 CLIP 的视觉和文本模态进行对齐的方法。我们的两阶段流程处理了上述分布偏移,扩展了 CLIP 的零样本能力,并用领域特定知识丰富了 CLIP 的共享嵌入空间。首先,我们根据 PAINT(Ilharco et al., 2022)补丁协议对 CLIP 进行鲁棒微调,以应对分布偏移。在此基础之上,我们通过从 CLIP 视觉和文本编码器蒸馏知识,促进了 RS 模态编码器的跨模态对齐。我们实证表明,在多个 RS 影像分类和跨模态检索基准数据集上,补丁和跨模态对齐均带来了显著的性能提升。值得注意的是,这些提升是在不依赖文本描述、不引入任何任务特定参数、不从零开始训练且没有灾难性遗忘的情况下实现的。我们在 https://github.com/Orion-AI-Lab/MindTheModalityGap 公开了所有实验的代码实现和权重。
引用
@article{arxiv.2402.09816,
title = {Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment},
author = {Angelos Zavras and Dimitrios Michail and Begüm Demir and Ioannis Papoutsis},
journal= {arXiv preprint arXiv:2402.09816},
year = {2025}
}
备注
Accepted at the ISPRS Journal of Photogrammetry and Remote Sensing. Our code implementation and weights for all experiments are publicly available at https://github.com/Orion-AI-Lab/MindTheModalityGap