SatCLIP:基于卫星影像的全球通用位置嵌入
计算机视觉与模式识别
2024-04-16 v3 人工智能
计算机与社会
机器学习
摘要
地理信息对于从生态学到流行病学等领域中的建模任务至关重要。然而,针对给定任务提取相关位置特征可能颇具挑战,常需昂贵的数据融合或从海量全球影像数据集中提炼。为应对这一挑战,我们引入了卫星对比位置-图像预训练(SatCLIP)。这一全球通用地理位置编码器通过将 CNN 和 ViT 推断的开放卫星影像视觉模式与其地理坐标相匹配,学习位置的隐式表示。所得的 SatCLIP 位置编码器高效概括了任意给定位置的特征,便于在下游任务中使用。在我们的实验中,我们使用 SatCLIP 嵌入在九项多样的位置依赖任务上提升预测性能,包括温度预测、动物识别和人口密度估计。跨任务来看,SatCLIP 持续优于其他位置编码器,并通过编码空间遥远环境的视觉相似性改善了地理泛化能力。这些结果展示了视觉-位置模型从庞大、多样且基本未开发的地理空间数据模态中学习地球有意义表示的潜力。
引用
@article{arxiv.2311.17179,
title = {SatCLIP: Global, General-Purpose Location Embeddings with Satellite Imagery},
author = {Konstantin Klemmer and Esther Rolf and Caleb Robinson and Lester Mackey and Marc Rußwurm},
journal= {arXiv preprint arXiv:2311.17179},
year = {2024}
}