中文

基于阻尼牛顿法的无模型 $\delta$-策略迭代用于非线性连续时间 H$\infty$ 跟踪控制

机器学习 2024-01-24 v1

摘要

本文提出一种基于阻尼牛顿方法的 δ\delta-PI 算法,用于未知连续时间非线性系统的 H\infty 跟踪控制问题。使用折扣性能函数和增广系统来获取跟踪 Hamilton-Jacobi-Isaac(HJI)方程。跟踪 HJI 方程是非线性偏微分方程,求解该方程的传统强化学习方法大多基于牛顿法,通常仅满足局部收敛且需要良好的初始猜测。基于阻尼牛顿迭代算子方程,首先推导出广义跟踪 Bellman 方程。δ\delta-PI 算法可通过迭代求解广义跟踪 Bellman 方程来寻找跟踪 HJI 方程的最优解。分别提供了同策略学习和异策略学习 δ\delta-PI 强化学习方法。异策略版本的 δ\delta-PI 算法是一种无模型算法,可在不利用系统动力学先验知识的情况下执行。展示了异策略 δ\delta-PI 算法的基于神经网络(NN)的实现方案。通过非线性系统仿真说明了无模型 δ\delta-PI 算法的适用性。

关键词

引用

@article{arxiv.2401.12882,
  title  = {Model-Free $\delta$-Policy Iteration Based on Damped Newton Method for Nonlinear Continuous-Time H$\infty$ Tracking Control},
  author = {Qi Wang},
  journal= {arXiv preprint arXiv:2401.12882},
  year   = {2024}
}

备注

10 pages, 8 figures