中文

预训练何处进行?探究预训练数据多样性对地理空间基础模型性能的影响

计算机视觉与模式识别 2026-04-24 v1 机器学习

摘要

新的地理空间基础模型引入了新的模型架构和预训练数据集,常常使用不同的多样性概念进行采样。性能差异主要归因于模型架构或输入模态,而预训练数据集的作用鲜有研究。为填补这一研究空白,我们进行了一项系统性研究,探讨了预训练数据的地理组成如何影响模型的下游性能。我们创建了全球和按大陆划分的预训练数据集,并在全球和按大陆划分的下游数据集上进行评估。我们发现来自欧洲的预训练数据集在全球和局部下游评估中均优于全球和大陆特定的预训练数据集。为探讨影响预训练数据集下游性能的因素,我们分析了 10 个预训练数据集的多样性——包括大陆多样性、生态系统多样性、土地覆盖多样性和光谱值多样性。我们发现,只有光谱多样性与性能强相关,而其他多样性指标与性能关联较弱。这一发现确立了一种新的多样性维度,用于创建高性能预训练数据集。我们开源了 7 个新的预训练数据集、预训练模型以及实验框架,地址为 https://github.com/kerner-lab/pretrain-where。

关键词

引用

@article{arxiv.2604.21104,
  title  = {Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance},
  author = {Amandeep Kaur and Mirali Purohit and Gedeon Muhawenayo and Esther Rolf and Hannah Kerner},
  journal= {arXiv preprint arXiv:2604.21104},
  year   = {2026}
}

备注

Accepted at EarthVision workshop, CVPR 2026