中文

面向高保真地球系统模型的频率感知 Vision Transformer

计算机视觉与模式识别 2026-02-19 v5

摘要

超分辨率在增强地球系统模型输出的空间保真度方面发挥着关键作用,使Climate Science 所获益的细尺度结构能够从粗糙模拟中恢复。然而,传统深度超分辨率方法,包括卷积和 transformer 基于模型,往往呈现谱偏差,更容易重建低频内容而非有价值的高频细节。在本工作中,我们引入 ViSIR 和 ViFOR 两个频率感知框架。ViSIR 是 Vision Transformer-Tuned 余弦隐式表示,组合视觉 transformer 与余弦激活以缓解谱偏差。ViFOR 是 Vision Transformer 傅里叶表示网络,集成显式傅里叶滤波以独立学习低频和高频。我们在 E3SM-HR 地球系统数据集上评估了这些模型,覆盖表面温度、短波和长波通量。这些模型超越了领先的卷积神经网络、生成网络和基础 transformer 基线,ViFOR 在峰值信噪比上提升最高可达 2.6 dB,结构相似性也更高。

关键词

引用

@article{arxiv.2502.12427,
  title  = {Frequency-Aware Vision Transformers for High-Fidelity Super-Resolution of Earth System Models},
  author = {Ehsan Zeraatkar and Salah A Faroughi and Jelena Tešić},
  journal= {arXiv preprint arXiv:2502.12427},
  year   = {2026}
}