基于阻尼牛顿法的无模型 $\delta$-策略迭代用于非线性连续时间 H$\infty$ 跟踪控制
机器学习
2024-01-24 v1
摘要
本文提出一种基于阻尼牛顿方法的 -PI 算法,用于未知连续时间非线性系统的 H 跟踪控制问题。使用折扣性能函数和增广系统来获取跟踪 Hamilton-Jacobi-Isaac(HJI)方程。跟踪 HJI 方程是非线性偏微分方程,求解该方程的传统强化学习方法大多基于牛顿法,通常仅满足局部收敛且需要良好的初始猜测。基于阻尼牛顿迭代算子方程,首先推导出广义跟踪 Bellman 方程。-PI 算法可通过迭代求解广义跟踪 Bellman 方程来寻找跟踪 HJI 方程的最优解。分别提供了同策略学习和异策略学习 -PI 强化学习方法。异策略版本的 -PI 算法是一种无模型算法,可在不利用系统动力学先验知识的情况下执行。展示了异策略 -PI 算法的基于神经网络(NN)的实现方案。通过非线性系统仿真说明了无模型 -PI 算法的适用性。
引用
@article{arxiv.2401.12882,
title = {Model-Free $\delta$-Policy Iteration Based on Damped Newton Method for Nonlinear Continuous-Time H$\infty$ Tracking Control},
author = {Qi Wang},
journal= {arXiv preprint arXiv:2401.12882},
year = {2024}
}
备注
10 pages, 8 figures