中文

基于 Vision Transformer 的多变量气候下采样:共享编码器与多解码器架构模拟区域气候模型

机器学习 2026-02-17 v2 人工智能 图像与视频处理

摘要

全球气候模型(GCM)对于模拟大尺度气候动力学至关重要,但其粗糙的空间分辨率限制了其在区域研究中的适用性。区域气候模型(RCM)通过动态下采样克服了这一限制,尽管计算成本高昂且灵活性有限。深度学习作为一种高效的数据驱动方法已涌现,但大多数现有方法仅聚焦于单变量模型,对每一种变量单独下采样。这种范式可能导致冗余计算、有限的上下文感知和较弱的跨变量相互作用。为此,我们提出了一种多变量 Vision Transformer(ViT)架构,采用共享编码器和变量特定解码器(1EMD)。该模型从 GCM 分辨率的输入直接预测六个关键气候变量:表面温度、风速、500 hPa 大气位力高度、总降水、表面短波辐射和表面长波辐射,模拟欧洲地区的 RCM尺度下采样。与单变量 ViT 模型相比,1EMD 架构在所有六个变量上均实现了性能提升,平均 MSE 降低约为 5.5%。在公平且受控的比较下,它持续优于包括单解码器 ViT 和多变量 U-Net 在内的其他多变量基线方法。此外,多变量模型显著降低了计算成本,推理时间每变量降低 29-32%。总体而言,我们的结果表明,多变量建模在提高高分辨率气候下采样的准确性和效率方面具有系统性优势。在所评估的架构中,提出的 1EMD ViT 在预测性能和计算成本之间实现了最佳的权衡。

关键词

引用

@article{arxiv.2506.22447,
  title  = {Vision Transformers for Multi-Variable Climate Downscaling: Emulating Regional Climate Models with a Shared Encoder and Multi-Decoder Architecture},
  author = {Fabio Merizzi and Harilaos Loukos},
  journal= {arXiv preprint arXiv:2506.22447},
  year   = {2026}
}