中文

地理空间基础模型的规模律:基于 PhilEO Bench 的案例研究

计算机视觉与模式识别 2026-01-21 v5

摘要

基础模型(FMs)通过利用大规模预训练在多个领域实现最先进性能。在地球观测(EO)领域, petabyte 级卫星档案的可用性最近使地理空间基础模型(GFMs)得以发展。然而,关于数据集规模、模型架构与大小如何相互作用以决定下游性能的根本问题仍存疑问。本文通过在三个数据集规模上进行预训练和微调来系统性地探索这一设计空间:PhilEO Globe(0.5TB)、FastTOM(2TB,本文首次引入)以及 MajorTOM(23TB)。我们评估了三个架构家族:Geo-Aware U-Net(CNN)、ViT-UPerNet(Transformer)和 Mamba(状态空间模型);模型参数规模范围为 44M 至 300M。所有模型在 PhilEO Bench 上进行基准测试,涵盖道路密度和建筑密度回归、土地覆盖分段等任务,并与现有 GFMs 如 TerraMind 和 Prithvi-EO-2.0 进行比较。我们的结果表明,CNN 基于模型在低样本设置下仍保持高度竞争力,200M 参数的 Geo-Aware U-Net 在回归任务中超越更大规模的架构。然而,当规模扩展至多太级数据集时,ViT-UPerNet 实现最佳性能,尤其在 MajorTOM(23TB)上的语义分段任务中表现突出。最后,我们首次对 Mamba 模型在 EO 中的广泛评估,凸显其潜在效率优势,尽管需要更大规模的预训练才能完全匹配 CNN 和 ViT 的性能。所有代码、预训练模型以及 FastTOM 数据集均公开发布,为 GFMs 的规模律进一步探索提供可重复性和扩展性。

关键词

引用

@article{arxiv.2506.14765,
  title  = {Scaling Laws for Geospatial Foundation Models: A case study on PhilEO Bench},
  author = {Nikolaos Dionelis and Riccardo Musto and Jente Bosmans and Simone Sarti and Giancarlo Paoletti and Peter Naylor and Valerio Marsocci and Sébastien Lefèvre and Bertrand Le Saux and Nicolas Longépé},
  journal= {arXiv preprint arXiv:2506.14765},
  year   = {2026}
}

备注

11 pages, 12 figures, 3 tables, Submitted