基于神经网络的求解高维静态哈密顿-雅可比-贝尔曼偏微分方程的行动者-评论者方法
最优化与控制
2022-01-07 v2 数值分析
数值分析
摘要
我们提出了一种求解高维哈密顿-雅可比-贝尔曼(HJB)型椭圆偏微分方程(PDEs)的新数值方法。将HJB PDEs重新表述为最优控制问题,并借助受强化学习启发的行动者-评论者框架,基于值函数与控制函数的神经网络参数化加以解决。在行动者-评论者框架内,我们采用策略梯度方法来改进控制;而对于值函数,我们利用随机微积分推导了方差缩减的最小二乘时序差分方法。为对随机控制问题进行数值离散,我们采用自适应步长方案以提高靠近区域边界处的精度。给出了高达空间维度的数值算例,包括线性二次型调节器、随机范德波尔振子、扩散程函方程以及由调节器问题导出的完全非线性椭圆PDEs,以验证所提方法的有效性。
引用
@article{arxiv.2102.11379,
title = {Actor-Critic Method for High Dimensional Static Hamilton--Jacobi--Bellman Partial Differential Equations based on Neural Networks},
author = {Mo Zhou and Jiequn Han and Jianfeng Lu},
journal= {arXiv preprint arXiv:2102.11379},
year = {2022}
}
备注
23 pages, 4 figures. Add a fully nonlinear example