中文

Cryo-Bench:面向冰冠应用的基础模型基准测试

计算机视觉与模式识别 2026-04-03 v2

摘要

地理基础模型(GFMs)已在包括多个领域的广泛地球观测任务中得到评估,并显示出即使在稀疏标签下也能生产可靠地图的强大潜力。然而,针对冰冠应用的GFMs基准测试仍有限,主要due于缺乏合适的评估数据集。为填补这一空白,我们引入\textbf{Cryo-Bench},该基准测试旨在评估GFMs在关键冰冠组成部分的性能。Cryo-Bench包括碎石覆盖冰川、冰湖、海冰和冰岩前缘,涵盖多个传感器和广泛的地理区域。我们评估了14个GFMs以及UNet和ViT基线,以评估其优势、局限性和最佳使用策略。在冻结编码器的情况下,UNet实现了\textbf{66.38}的平均mIoU,紧随其后的是TerraMind,实现了\textbf{64.02}。在少量样本设置(10%输入数据)下,GFMs如DOFA和TerraMind超越UNet,分别以\textbf{59.53}、\textbf{56.62}和\textbf{56.60}的mIoU得分,与UNet的56.60相比。当完全微调GFMs时,我们观察到数据集和模型之间性能不一致。然而,调整学习率并进行微调可显著提高GFMs的性能。例如,在两个代表性数据集(GLID和CaFFe)上的评估显示,平均相对改进为\textbf{12.77%}。尽管GFMs在预训练数据中对冰冠的表示很少,但它们仍展现出显著的域适应能力,能够在各类任务中产生有意义的结果。基于我们的发现,我们建议在需要快速结果而无需大量实验时使用冻结编码器;而在追求最佳性能时,建议进行编码器微调并进行超参数优化。\url{https://github.com/Sk-2103/Cryo-Bench}。

关键词

引用

@article{arxiv.2603.01576,
  title  = {Cryo-Bench: Benchmarking Foundation Models for Cryosphere Applications},
  author = {Saurabh Kaushik and Lalit Maurya and Beth Tellman},
  journal= {arXiv preprint arXiv:2603.01576},
  year   = {2026}
}