中文

FLAVARS:一种用于遥感的多模态基础语言和视觉对齐模型

计算机视觉与模式识别 2025-01-16 v1 机器学习

摘要

遥感图像包含丰富的对象和上下文视觉信息。最近的趋势是将配对的卫星图像和文本标题组合,用于预训练各种下游任务的编码器。然而,虽然对比图像-文本方法如CLIP能够实现视觉-语言对齐和零样本分类能力,但针对视觉任务的下游性能相对于图像-文本预训练方法(如MAE)会下降。在本文中,我们提出了FLAVARS,一种结合对比学习和掩码建模,并通过对比位置编码实现地理空间对齐的预训练方法。我们发现,FLAVARS在视觉任务(如KNN分类和语义分割)方面显著优于SkyCLIP基线,在SpaceNet1上实现+6% mIOU,而且能够实现零样本分类,与MAE预训练方法不同。

关键词

引用

@article{arxiv.2501.08490,
  title  = {FLAVARS: A Multimodal Foundational Language and Vision Alignment Model for Remote Sensing},
  author = {Isaac Corley and Simone Fobi Nsutezo and Anthony Ortiz and Caleb Robinson and Rahul Dodhia and Juan M. Lavista Ferres and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2501.08490},
  year   = {2025}
}