用于非线性鲁棒控制的三元策略迭代算法
系统与控制
2020-07-15 v1 计算机科学与博弈论
机器学习
系统与控制
摘要
被控对象动力学中的不确定性仍是非线性控制问题的挑战。本文提出一种三元策略迭代(TPI)算法,用于求解具有有界不确定性的非线性鲁棒控制问题。将系统的控制器与不确定性视为博弈参与者,并将鲁棒控制问题表述为二人零和微分博弈。为求解该微分博弈,推导了相应的 Hamilton-Jacobi-Isaacs(HJI)方程。设计了三个损失函数与三个更新阶段,分别匹配 HJI 方程的恒等式、最小化与最大化。这些损失函数由生成状态集中近似哈密顿量的期望定义,以避免同时操作整个状态集中的所有状态。值函数与策略的参数通过梯度下降法减小所设计的损失函数直接更新。此外,控制策略的参数可采用零初始化。通过两项仿真研究验证了所提 TPI 算法的有效性。仿真结果表明,TPI 算法可收敛至线性对象的最优解,并对非线性对象具有强抗扰性。
引用
@article{arxiv.2007.06810,
title = {Ternary Policy Iteration Algorithm for Nonlinear Robust Control},
author = {Jie Li and Shengbo Eben Li and Yang Guan and Jingliang Duan and Wenyu Li and Yuming Yin},
journal= {arXiv preprint arXiv:2007.06810},
year = {2020}
}