基于离策略风险敏感强化学习的最优跟踪控制及其规定性能实现
系统与控制
2020-09-02 v1 系统与控制
摘要
针对最优跟踪控制问题,提出了一种基于离策略强化学习的控制策略,以在学习过程中实现全状态的规定性能。基于辅助系统,将最优跟踪控制问题转化为最优调节问题。将规定性能的要求转化为约束满足问题,并在优化框架下通过风险敏感状态惩罚项加以处理。为获得 Hamilton Jacobi Bellman 方程的近似解,利用当前数据与经验数据共同构建了离策略自适应评判学习架构。通过使用经验数据,所提出的评判学习智能体权值估计更新律保证了权值收敛到实际值。与需要引入外部信号以满足权值收敛的持续激励条件的常用方法相比,该技术具有实用性。给出了闭环系统稳定性与权值收敛性的证明。仿真结果验证了所提出的基于离策略风险敏感强化学习控制策略的有效性。
引用
@article{arxiv.2009.00476,
title = {Off Policy Risk Sensitive Reinforcement Learning Based Optimal Tracking Control with Prescribe Performances},
author = {C. Li and Y. Wang and F. Liu and M. Buss},
journal= {arXiv preprint arXiv:2009.00476},
year = {2020}
}
备注
arXiv admin note: text overlap with arXiv:2006.05681