中文

MMEarth:探索地理空间表示学习的多模态预文本任务

计算机视觉与模式识别 2024-07-30 v2 人工智能 机器学习

摘要

未标注的地球观测(EO)数据量巨大,但许多重要应用缺乏标注的训练数据。然而,EO数据提供了独特的机会,可以基于地理位置和时间自动配对来自不同模态和传感器的数据,几乎无需人力成本。我们抓住这一机会创建了MMEarth,这是一个全球规模的多模态预训练数据集。利用这个包含120万个位置的新语料库,我们提出了一种多预文本掩码自编码器(MP-MAE)方法,用于学习光学卫星图像的通用表示。我们的方法基于ConvNeXt V2架构,这是一种全卷积掩码自编码器(MAE)。利用一系列多模态预文本任务,我们证明了MP-MAE方法在性能上优于在ImageNet上预训练的MAE和在领域特定卫星图像上预训练的MAE。这在多个下游任务(包括图像分类和语义分割)上得到了验证。我们发现,与仅在光学卫星图像上预训练相比,使用多模态预文本任务进行预训练显著提高了线性探测性能。这也带来了更好的标签效率和参数效率,这对于全球规模的应用至关重要。

关键词

引用

@article{arxiv.2405.02771,
  title  = {MMEarth: Exploring Multi-Modal Pretext Tasks For Geospatial Representation Learning},
  author = {Vishal Nedungadi and Ankit Kariryaa and Stefan Oehmcke and Serge Belongie and Christian Igel and Nico Lang},
  journal= {arXiv preprint arXiv:2405.02771},
  year   = {2024}
}

备注

Accepted for ECCV 2024. Data and code: https://vishalned.github.io/mmearth Update arXiv v2 (ECCV): 1. Dataset fix: Removed duplicates and corrected ERA5 yearly statistics. 2. Data augmentation fix: Random crops are now aligned. 3. Test metrics fix: Metrics are now overall instead of mini-batch averages, matching GEO-Bench metrics. 4. Pretrained on MMEarth v001 & evaluated on GEO-Bench v1.0