面向随机最优控制的神经策略迭代:一种物理信息方法
机器学习
2025-08-05 v1 计算工程、金融与科学
数值分析
数值分析
摘要
我们提出一种基于物理信息神经网络的策略迭代(PINN-PI)框架,用于求解由二阶Hamilton-Jacobi-Bellman(HJB)方程控制的随机最优控制问题。在每一次迭代中,训练神经网络以最小化固定策略诱导的线性PDE残差来逼近价值函数。这种线性结构使得每一步策略评估能够系统地控制误差,并允许我们推导出明确的Lipschitz型界限,量化价值梯度误差如何传播到策略更新。这一可解释性为在训练期间评估策略质量提供了理论依据。我们的方法扩展了最近的确定性PINN方法,适用于随机情形,继承了经典策略迭代在温和条件下的全局指数收敛保证。我们在多个基准问题上展示了方法的有效性,包括随机cartpole、摆锤问题以及最高可达10维的高维线性二次型控制(LQR)问题。
引用
@article{arxiv.2508.01718,
title = {Neural Policy Iteration for Stochastic Optimal Control: A Physics-Informed Approach},
author = {Yeongjong Kim and Yeoneung Kim and Minseok Kim and Namkyeong Cho},
journal= {arXiv preprint arXiv:2508.01718},
year = {2025}
}