中文

大规模基于 Transformer 的天气预测训练配方分析与探索

机器学习 2024-05-01 v1

摘要

深度学习 (DL) 在数值天气预报 (NWP) 中的快速崛起导致模型数量激增,这些模型对大气变量的预测技能与传统基于物理的 NWP 相当或更优。然而,在这些领先的 DL 模型中,训练设置和所用架构差异很大。此外,缺乏详尽的消除实验使得难以判断哪些组件对成功最为关键。本文表明,即使采用相对常规的架构、简单的训练程序和中等计算预算,也可以实现高水平的预测技能。具体而言,我们在 ERA5 数据上对经过最小修改的 SwinV2 transformer 进行训练,发现其对抗 IFS 的预测技能更佳。我们对训练管道的关键方面进行消除实验,探索不同的损失函数、模型规模和深度,以及多步微调,以考察其影响。我们还检查模型在通常使用的 ACC 和 RMSE 之外的指标上的表现,探讨模型规模如何影响性能。

关键词

引用

@article{arxiv.2404.19630,
  title  = {Analyzing and Exploring Training Recipes for Large-Scale Transformer-Based Weather Prediction},
  author = {Jared D. Willard and Peter Harrington and Shashank Subramanian and Ankur Mahesh and Travis A. O'Brien and William D. Collins},
  journal= {arXiv preprint arXiv:2404.19630},
  year   = {2024}
}

备注

9 pages, 6 figures