使用 MRAC-RL 的实时控制在线策略
系统与控制
2021-10-20 v1 系统与控制
摘要
本文中,我们提出模型参考自适应控制与强化学习(MRAC-RL)方法,为实时出现建模误差的系统开发在线策略。尽管强化学习(RL)算法已成功用于开发动力学系统的控制策略,但模拟动力学与真实目标动力学之间的差异会导致训练策略在真实世界部署时无法适当泛化与适应。MRAC-RL 框架通过结合内环自适应控制器与仿真训练的外环 RL 策略来生成在线策略。该结构使 MRAC-RL 能在目标环境中有效适应与运行,即使存在参数不确定性。我们提出一组新颖的 MRAC 算法,将其应用于一类非线性系统,推导相应控制律,为所得闭环系统提供稳定性保证,并证明实现了自适应跟踪目标。通过自动四旋翼着陆任务的仿真研究,我们展示了 MRAC-RL 方法通过生成在线策略改进了 SOTA RL 算法与技术。
引用
@article{arxiv.2103.16551,
title = {Online Policies for Real-Time Control Using MRAC-RL},
author = {Anubhav Guha and Anuradha Annaswamy},
journal= {arXiv preprint arXiv:2103.16551},
year = {2021}
}
备注
Submitted to CDC 2021