中文

关于通过持续训练实现天气仿真的神经网络尺度律

机器学习 2026-03-27 v1

摘要

神经网络尺度律在某些领域可以预测大型神经网络性能随模型、数据和计算规模的变化,这是自然语言处理和计算机视觉中构建基础模型的基石。我们聚焦于科学机器学习中的神经网络尺度问题,特别是天气预报模型。为尽可能简单地分析尺度行为,我们采用最小且可扩展的通用 Swin Transformer 架构,并使用恒定学习率和周期性冷却作为高效训练策略。我们展示,采用这种极简方式训练的模型遵循可预测的尺度趋势,甚至能超过标准余弦学习率计划。冷却阶段可以被重新用于提高下游性能,例如实现更长 forecast 时间段内的准确多步 rollout,以及通过谱损失调整获得更尖锐的预测。我们还系统地探索了在各种计算预算下广泛的模型和数据集大小,以构建 IsoFLOP 曲线,并识别出计算最优的训练方案。将这些趋势外推至更大规模后表明潜在的性能限制,证明神经网络尺度可作为高效资源分配的重要诊断工具。我们开源了代码以便复现。

关键词

引用

@article{arxiv.2603.25687,
  title  = {On Neural Scaling Laws for Weather Emulation through Continual Training},
  author = {Shashank Subramanian and Alexander Kiefer and Arnur Nigmetov and Amir Gholami and Dmitriy Morozov and Michael W. Mahoney},
  journal= {arXiv preprint arXiv:2603.25687},
  year   = {2026}
}

备注

ICLR Foundation Models for Science Workshop 2026, 19 pages, 13 figures