中文

基于 PDE 控制的多级强化学习框架

机器学习 2022-10-31 v2 系统与控制 系统与控制

摘要

强化学习(RL)是一种有前景的解决控制问题的方法。然而,无模型 RL 算法样本效率低,需要成千上万乃至数百万样本来学习最优控制策略。RL 中计算成本的一个主要来源对应于由模型动力学决定的转移函数。当模型动力学由耦合 PDE 表示时,这尤其成问题。在此类情况下,转移函数通常涉及求解所述 PDE 的大规模离散化。我们提出一种多级 RL 框架,通过利用对应于较粗尺度离散化(即多级模型)的子级模型来减轻该成本。这是通过制定策略和价值网络目标函数的近似多级蒙特卡洛估计,而非经典框架中所做的蒙特卡洛估计来实现的。作为该框架的演示,我们提出了近端策略优化(PPO)算法的多级版本。此处,级别指的是所选基于仿真的环境的网格保真度。我们提供了两个采用随机 PDE 的基于仿真的环境示例,这些 PDE 使用有限体积离散化求解。对于所呈现的案例研究,我们观察到使用多级 PPO 相比其经典对应物实现了 substantial 的计算节省。

关键词

引用

@article{arxiv.2210.08400,
  title  = {A Multilevel Reinforcement Learning Framework for PDE-based Control},
  author = {Atish Dixit and Ahmed Elsheikh},
  journal= {arXiv preprint arXiv:2210.08400},
  year   = {2022}
}

备注

In preparation for submission to a journal