面向可扩展多智能体强化学习的气候替代模型:基于 CICERO-SCM 的案例研究
机器学习
2025-10-10 v1 多智能体系统
摘要
气候政策研究需要能够捕捉多种温室气体对全球温度综合影响的模型,但这些模型计算昂贵且难以嵌入强化学习。我们提出了一个多智能体强化学习(MARL)框架,将高保真、高效的气候替代模型直接集成到环境循环中,使区域智能体能够在多气体动力学下学习气候政策。作为概念验证,我们引入了一个在 () 多气体排放路径上预训练的循环神经网络架构,用于替代气候模型 CICERO-SCM。该替代模型在全球平均温度 RMSE 时接近仿真器精度,单步推理速度约为原模型的 。当替代模型取代原始仿真器用于气候政策 MARL 场景时,可加速端到端训练超过 。我们展示了替代模型与仿真器收敼至相同的最优政策,并提出了一种评估该性质的方法,这在使用仿真器不可行的情况下尤为重要。我们的工作在不牺牲政策保真度的前提下,绕过了核心计算瓶颈,使能够在具有多气体动力学和高保真气候响应的替代气候政策情景下进行大规模多智能体实验。
引用
@article{arxiv.2510.07971,
title = {Climate Surrogates for Scalable Multi-Agent Reinforcement Learning: A Case Study with CICERO-SCM},
author = {Oskar Bohn Lassen and Serio Angelo Maria Agriesti and Filipe Rodrigues and Francisco Camara Pereira},
journal= {arXiv preprint arXiv:2510.07971},
year = {2025}
}