超越可见范围:基于多光谱的地球观察视觉语言学习
计算机视觉与模式识别
2025-08-05 v3 人工智能
摘要
地球观察(EO)的视觉语言模型通常仅依赖可见光谱数据作为模型输入,无法利用卫星记录的多光谱信道所包含的丰富光谱信息。因此,我们提出 Llama3-MS-CLIP,这是首个在大规模多光谱数据集上进行对比学习预训练的视觉语言模型,并报告了由于扩展光谱范围所带来的性能提升。此外,我们构建了目前规模最大的多光谱图像-文本数据集,包含一百万枚 Sentinel-2 样本及其对应的文本描述,文本描述通过 Llama3-LLaVA-Next 和 Overture Maps 数据生成。我们开发了一个可扩展的标注管道,并通过领域专家进行了验证。在三个不同复杂性的数据集上对 Llama3-MS-CLIP 进行多光谱零样本图像分类和检索评估。我们的结果表明,Llama3-MS-CLIP 在分类准确率上显著优于其他基于 RGB 的方法,平均提升 6.77%;在检索性能上将 mAP 提升 4.63%。我们的结果凸显了多光谱视觉语言学习的相关性。图像-文本数据集、代码和模型权重均已公开于 https://github.com/IBM/MS-CLIP。
引用
@article{arxiv.2503.15969,
title = {Beyond the Visible: Multispectral Vision-Language Learning for Earth Observation},
author = {Clive Tinashe Marimo and Benedikt Blumenstiel and Maximilian Nitsche and Johannes Jakubik and Thomas Brunschwiler},
journal= {arXiv preprint arXiv:2503.15969},
year = {2025}
}
备注
Machine Learning and Knowledge Discovery in Databases. Research Track - European Conference, ECML PKDD 2025