面向地球系统模型的 Vision Transformer 单图像重建方法——ViSIR
计算机视觉与模式识别
2025-05-27 v3
摘要
目的:地球系统模型(ESM)整合了大气、海洋、陆地、冰层和生物球在各种条件下的相互作用,以估计区域和全球气候的状态。地球系统模型高度复杂,因此使用深度神经网络架构来建模这种复杂性并存储降采样后的数据。本文提出了 Vision Transformer 正弦表示网络(ViSIR)以改进 ESM 数据的单图像超分辨率(SR)重建任务。方法:ViSIR 将 Vision Transformer(ViT)的 SR 能力与 Sinusoidal Representation Network(SIREN)的高频细节保留相结合,以解决 SR 任务中观察到的谱偏差。结果:在三个不同测量指标上,ViSIR 分别比 SRCNN 提高 2.16 dB,比 ViT 提高 6.29 dB,比 SIREN 提高 8.34 dB,比 SR-生成式对抗网络(SRGANs)提高 7.93 dB。结论:对所提出的 ViSIR 进行了评估和与最先进的方法比较。结果表明,该提议算法在均方误差(MSE)、峰值信噪比(PSNR)和结构相似性指数(SSIM)方面优于其他方法。
引用
@article{arxiv.2502.06741,
title = {ViSIR: Vision Transformer Single Image Reconstruction Method for Earth System Models},
author = {Ehsan Zeraatkar and Salah Faroughi and Jelena Tešić},
journal= {arXiv preprint arXiv:2502.06741},
year = {2025}
}