Hamilton-Jacobi-Bellman PDE 的神经 Actor-Critic 方法:渐近分析与数值研究
最优化与控制
2026-05-20 v2 机器学习
数值分析
数值分析
机器学习
摘要
我们对用于求解高维Hamilton-Jacobi-Bellman(HJB)偏微分方程的Actor-Critic机器学习算法进行数学分析和数值研究。评估器(价值函数估计器)的体系结构设计使得边界条件始终完美满足(而非纳入训练损失),并利用偏置梯度以降低计算成本。动作员(最优控制估计器)通过最小化域上哈密顿量的积分来进行训练,其中哈密顿量由评估器估计。我们证明,随着动作员和评估器神经网络中隐层单元数的无限增长,其训练动力学在Sobolev空间中收敛于某种无限维常微分方程(ODE)。进一步地,在哈密顿量具有类凸性假设下,我们证明了该限制ODE的任意固定点都是原始随机控制问题的解。这为该算法在面对神经网络损失函数非凸性导致有限宽度网络仅收敛于局部极小值(而非最优解)的情况下的性能提供了重要保证。在数值研究中,我们展示了该算法能够准确求解最高达200维的随机控制问题。具体地,我们构建了一系列日益复杂的随机控制问题,其具有已知解析解,并研究了该算法在其上的数值性能。这些问题从线性-二次调节器方程到具有非凸哈密顿量的高度具有挑战性的方程,使我们得以识别和分析该神经Actor-Critic方法在求解HJB方程方面的优势与局限。
引用
@article{arxiv.2507.06428,
title = {Neural Actor-Critic Methods for Hamilton-Jacobi-Bellman PDEs: Asymptotic Analysis and Numerical Studies},
author = {Samuel N. Cohen and Jackson Hebner and Deqing Jiang and Justin Sirignano},
journal= {arXiv preprint arXiv:2507.06428},
year = {2026}
}
备注
46 pages