中文

基于变增益梯度下降的强化学习用于含输入约束不确定非线性系统的鲁棒最优跟踪控制

系统与控制 2020-06-16 v5 系统与控制

摘要

近年来,针对含输入约束的连续时间非线性系统最优跟踪问题,提出了多种强化学习(RL)算法。这些算法大多基于一致最终有界(UUB)稳定的概念,通常为避免状态误差振荡过大而采用较低的学习率。然而,这是以评论家神经网络权值收敛时间更长为代价的。本文通过提出一种包含变增益梯度下降的新型调谐律来解决该问题,该调谐律可根据 Hamilton-Jacobi-Bellman(HJB)误差调整评论家神经网络的学习率。通过允许高学习率,所提出的变增益梯度下降调谐律能够改善评论家神经网络权值的收敛时间。同时,它也使增广系统轨迹收敛于其上的残差集更紧,从而导致状态误差中的振荡更小。本文证明了所提更新机制 UUB 稳定性的更紧界。随后给出数值研究,以验证该鲁棒强化学习控制方案在连续时间非线性系统控制中的有效性。

关键词

引用

@article{arxiv.1911.04157,
  title  = {Variable Gain Gradient Descent-based Reinforcement Learning for Robust Optimal Tracking Control of Uncertain Nonlinear System with Input-Constraints},
  author = {Amardeep Mishra and Satadal Ghosh},
  journal= {arXiv preprint arXiv:1911.04157},
  year   = {2020}
}