由变增益梯度下降驱动的仅评论家积分强化学习用于最优跟踪控制
系统与控制
2020-03-05 v4 系统与控制
摘要
积分强化学习(IRL)在文献中被提出以免除自适应动态规划框架中对漂移动力学的要求。文献中大多数在线 IRL 方案需要两组神经网络(NN),称为行动者-评论家 NN 和一个初始稳定控制器。最近,对于基于 RL 的鲁棒跟踪,可通过使用包含带仅评论家结构的稳定项且经修正的基于梯度下降的更新律,免除初始稳定控制器和双逼近器结构的要求。据作者所知,尚未有研究在 IRL 算法框架中利用此类稳定项来解决带执行器约束的连续时间非线性系统的最优轨迹跟踪问题。为此,本文提出了一种在 IRL 框架中利用稳定项与变增益梯度下降相结合的新型更新律。通过这些修正,IRL 跟踪控制器可仅使用评论家 NN 实现,同时无需初始稳定控制器。所提更新律的另一显著特征是其可变学习率,它根据瞬时 Hamilton-Jacobi-Bellman 误差和系统轨迹沿 Lyapunov 函数变化率来缩放学习步调。所增广的系统状态和 NN 权值误差在所给更新律下被证明具有一致最终有界(UUB)稳定性,并达到更紧的残差集。该更新律在一架完整 6-DoF 非线性 UAV 模型上进行了姿态控制验证。
引用
@article{arxiv.1911.04153,
title = {Critic-Only Integral Reinforcement Learning Driven by Variable Gain Gradient Descent for Optimal Tracking Control},
author = {Amardeep Mishra and Satadal Ghosh},
journal= {arXiv preprint arXiv:1911.04153},
year = {2020}
}
备注
Preprint of the manuscript under review at CDC+LCSS (2020)