中文

DOFA-CLIP:用于地球观测的多模态视觉-语言基础模型

计算机视觉与模式识别 2025-07-23 v2

摘要

地球观测(EO)涵盖了广泛的模态,包括光学、雷达、多光谱和高光谱数据,每种模态都捕获独特的环境信号。然而,当前地球观测中的视觉-语言模型,特别是基于 CLIP 的变体,仍局限于单一模态,限制了其在各种任务中的泛化能力和可扩展性。我们提出了 DOFA-CLIP(Dynamic-One-For-All CLIP),这是一种统一的视觉-语言基础模型,能够通过单一的 Transformer 主干和灵活的光谱配置动态适应各种地球观测模态。我们的方法引入了三个关键贡献:1)构建了 GeoLangBind-2M,这是一个大规模地球观测图文数据集,涵盖六种异构模态并附带丰富的自然语言描述;2)一种名为 VECT(视觉模型增强对比文本-图像预训练)的新型训练策略,利用多个视觉基础模型增强了 CLIP 特征的空间感知能力;3)一个模态感知知识聚合模块,通过特定模态感知来优化特征蒸馏。DOFA-CLIP 在广泛的地球观测基准上实现了最先进的零样本性能,包括未见过的模态和多种数量的输入光谱波段。这些贡献共同为多模态地球观测理解奠定了可扩展的基础,并为将异构地球观测数据与大语言模型整合开辟了新途径。代码和数据集将被发布。代码和数据集已公开发布。

关键词

引用

@article{arxiv.2503.06312,
  title  = {DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation},
  author = {Zhitong Xiong and Yi Wang and Weikang Yu and Adam J Stewart and Jie Zhao and Nils Lehmann and Thomas Dujardin and Zhenghang Yuan and Pedram Ghamisi and Xiao Xiang Zhu},
  journal= {arXiv preprint arXiv:2503.06312},
  year   = {2025}
}

备注

code & weights: https://github.com/xiong-zhitong/DOFA-CLIP