时间与空间上的反向传播:利用多智能体强化学习学习数值方法
机器学习
2022-03-30 v3 多智能体系统
计算物理
摘要
我们提出时间与空间上的反向传播(BPTTS),一种用于训练循环时空神经网络的方法,该方法在同质多智能体强化学习(MARL)设定中用于学习双曲守恒律的数值方法。我们将偏微分方程(PDEs)背后的数值格式视为强化学习(RL)中的部分可观测马尔可夫博弈(POMG)。与数值求解器类似,我们的智能体在计算空间的每个离散位置采取行动,以实现高效且可泛化的学习。为通过作用于局部状态来学习高阶空间方法,智能体必须辨别其在给定时空位置上的行动如何影响状态的未来演化。这种非平稳性的表现由 BPTTS 解决,其允许梯度跨越空间与时间流动。所学习的数值策略在 Burgers 方程与 Euler 方程两种设定下可与 SOTA 数值方法相媲美,并能很好地泛化至其他仿真设置。
引用
@article{arxiv.2203.08937,
title = {Backpropagation through Time and Space: Learning Numerical Methods with Multi-Agent Reinforcement Learning},
author = {Elliot Way and Dheeraj S. K. Kapilavai and Yiwei Fu and Lei Yu},
journal= {arXiv preprint arXiv:2203.08937},
year = {2022}
}