中文

基于仅评判器积分强化学习的执行器约束下未知连续时间非线性系统同时辨识与最优跟踪控制

系统与控制 2020-05-11 v3 系统与控制

摘要

为了消除自适应动态规划(ADP)中对漂移动力学的要求,积分强化学习(IRL)被提出作为贝尔曼方程的另一种表述。然而,仍需要控制耦合动力学以获得最优控制量的闭式表达式。此外,实现IRL方案还需要初始稳定控制器和两组神经网络(NN)(称为Actor-Critic)。本文利用评判器更新律中的稳定项,以避免IRL框架中对初始稳定控制器的需求,从而解决带执行器约束的最优跟踪问题。借助该项,IRL框架中仅需一个NN即可生成最优控制策略。该评判器网络与一个经验回放(ER)增强的辨识器耦合,以消除IRL算法中对控制耦合动力学的需求。辨识器和评判器NN的权重被同时更新,并且表明ER增强的辨识器比无ER增强时更能处理参数变化。该新颖更新律最显著的特征是其变学习率,它基于瞬时哈密顿-雅可比-贝尔曼(HJB)误差来缩放学习步调。如一致最终有界(UUB)稳定性证明所示,评判器NN中的变学习率与辨识器NN中的ER技术相结合,有助于为状态误差和NN权重误差实现更紧致的残差集。仿真结果在非线性系统上验证了所提出的“辨识器-评判器”NN。

关键词

引用

@article{arxiv.2002.12094,
  title  = {Simultaneous Identification and Optimal Tracking Control of Unknown Continuous Time Nonlinear System With Actuator Constraints Using Critic-Only Integral Reinforcement Learning},
  author = {Amardeep Mishra and Satadal Ghosh},
  journal= {arXiv preprint arXiv:2002.12094},
  year   = {2020}
}