一种用于非线性连续时间 H∞ 控制问题的新型策略迭代算法
系统与控制
2024-03-20 v1 系统与控制
摘要
非线性连续时间系统的 H∞ 控制依赖于 Hamilton-Jacobi-Isaacs (HJI) 方程的解,由于 HJI 方程的非线性,已证明不可能获得其闭式解。为了求解 HJI 方程,人们提出了许多迭代算法,当在 Banach 空间中构造不动点方程时,这些算法本质上大多是牛顿法。牛顿法是一种局部优化方法,其收敛域小,需要初始猜测足够接近解。而阻尼牛顿法则增强了对初始条件的鲁棒性,并具有更大的收敛域。本文引入了一种名为 α-策略迭代(α-PI)的新型强化学习方法用于求解 HJI 方程。首先,通过构造一个阻尼牛顿迭代算子方程,得到一个广义贝尔曼方程(Generalized Bellman Equation,GBE)。GBE 是贝尔曼方程的扩展。然后,通过在 GBE 上进行迭代,提出了一种无需使用系统内部动力学知识的在策略 α-PI 强化学习方法。第三,基于在策略 α-PI 强化学习方法,我们开发了一种无需任何系统动力学知识的离策略 α-PI 强化学习方法。最后,分别推导了在策略和离策略 α-PI 算法的基于神经网络的自适应评价实现方案,并使用批量最小二乘法计算神经网络的权重参数。通过计算机仿真验证了离策略 α-PI 算法的有效性。
引用
@article{arxiv.2401.13014,
title = {A Novel Policy Iteration Algorithm for Nonlinear Continuous-Time H$\infty$ Control Problem},
author = {Qi Wang},
journal= {arXiv preprint arXiv:2401.13014},
year = {2024}
}
备注
25 pages, 10 figures. arXiv admin note: text overlap with arXiv:2401.12882