中文

用强化学习中的状态依赖函数取代气象与气候模型中的可调参数

机器学习 2026-04-09 v2 大气与海洋物理

摘要

气象与气候模型依赖于参数化方案来表示亚网格过程。传统方案依赖固定系数,这些系数受约束较弱且在离线调优,导致持续偏差,限制了其适应底层物理的能力。本研究提出一种框架,通过强化学习(RL)在模型状态演化时学习参数化方案的组件,作为状态依赖函数,并在理想化测试环境中评估RL驱动的参数更新。测试环境包括简单气候偏差纠正(SCBC)、辐射对流平衡(RCE)以及单智能体和联邦多智能体设置下的 zonal 均能量平衡模型(EBM)。在九种RL算法中,Truncated Quantile Critics(TQC)、深度确定性策略梯度(DDPG)和双延迟DDPG(TD3)实现了最高的技能水平和稳定收敛,性能通过面积加权均方根误差(RMSE)、温度和气压层诊断进行评估。在EBM中,单智能体RL优于静态参数调优,尤其在热带和中纬度地区取得显著提升;而联邦RL在多智能体设置下实现专业化控制和更快收敛,六代理DDPG配置通过频繁聚合在热带和中纬度地区实现最低面积加权RMSE。所学得的修正也具有物理意义——智能体调制EBM辐射参数以减少纬度偏差,调整RCE斜率以匹配垂直温度误差,并稳定加热增量以限制漂移。总体而言,结果表明RL可在理想化环境中学习出色的状态依赖参数化组件,为数值模型中的在线学习提供可扩展路径,并为天气和气候模型中的实际应用奠定评估基础。

关键词

引用

@article{arxiv.2601.04268,
  title  = {Replacing Tunable Parameters in Weather and Climate Models with State-Dependent Functions using Reinforcement Learning},
  author = {Pritthijit Nath and Sebastian Schemm and Henry Moss and Peter Haynes and Emily Shuckburgh and Mark J. Webb},
  journal= {arXiv preprint arXiv:2601.04268},
  year   = {2026}
}

备注

77 pages, 24 figures