中文

基于全局多模态嵌入的少样本地球观测任务学习

计算机视觉与模式识别 2023-12-05 v2

摘要

在这项工作中,我们使用覆盖地球总陆地面积约 10% 的五个感兴趣区域(AOI)的三种不同模态卫星影像,预训练了一个基于 CLIP/ViT 的模型,即 Sentinel 2 RGB 光学影像、Sentinel 1 SAR 雷达振幅与干涉相干性。该模型使用 250\sim 250 M 参数。随后,我们将每种模态产生的嵌入与经典机器学习方法结合,尝试与植被、建成地表、农田和永久水体相关的不同地球观测下游任务。我们一致表明,我们将对标注数据的需求减少了 99%,因此仅用 ~200-500 个随机选取的标注样本(约 4K-10K km2^2)即可在所有模态、AOI 和下游任务上达到与使用完整标注数据集(每个感兴趣区域约 150K 图像块或 3M km2^2)相当的性能水平。这使我们认识到,该模型已捕获在广泛场景中可用的显著地球特征。为增强模型在实际中的可用性,其架构允许在缺失模态甚至各模态内缺失通道的情况下进行推理。此外,我们可视化展示了这一在无标签下获得的嵌入空间,对我们所选标注数据集所代表的不同地球特征具有敏感性。

关键词

引用

@article{arxiv.2310.00119,
  title  = {Fewshot learning on global multimodal embeddings for earth observation tasks},
  author = {Matt Allen and Francisco Dorr and Joseph A. Gallego-Mejia and Laura Martínez-Ferrer and Anna Jungbluth and Freddie Kalaitzis and Raúl Ramos-Pollán},
  journal= {arXiv preprint arXiv:2310.00119},
  year   = {2023}
}

备注

9 pages, 6 figures, presented on NeurIPS workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models