使用鲁棒动作管制的 Safe 强化学习
机器学习
2021-05-03 v2 系统与控制
系统与控制
摘要
强化学习(RL)本质上是一种试错学习过程,可能在探索与利用过程中引发不安全行为。这阻碍了 RL 在现实世界控制问题中的应用,尤其是那些安全关键系统。在本文中,我们引入了一种基于 RL 算法与附加安全监督模块(称为鲁棒动作管制器(RAG))集成的 Safe RL 框架,RAG 利用集合论技术与在线优化在学习过程中管理安全相关要求。我们通过其在汽车自适应巡航控制中的应用来说明该提出的 Safe RL 框架。
引用
@article{arxiv.2102.10643,
title = {Safe Reinforcement Learning Using Robust Action Governor},
author = {Yutong Li and Nan Li and H. Eric Tseng and Anouck Girard and Dimitar Filev and Ilya Kolmanovsky},
journal= {arXiv preprint arXiv:2102.10643},
year = {2021}
}