使用数据驱动预测控制的安全强化学习
机器人学
2022-11-22 v1 机器学习
系统与控制
系统与控制
摘要
强化学习(RL)算法在决策与连续控制任务中可达到最先进的性能。然而,由于许多 RL 算法的探索性质,尤其在机器人与环境模型未知时,将 RL 算法应用于安全关键系统仍须充分论证。为应对该挑战,我们提出一个数据驱动安全层,作为不安全动作的过滤器。该安全层使用数据驱动预测控制器,在训练与部署期间为 RL 策略提供安全保障。RL 智能体提出一个动作,通过计算数据驱动可达性分析进行验证。若使用所提动作的机器人可达集之间存在交集,我们调用数据驱动预测控制器来寻找最接近该不安全动作的_safe 动作。若所提动作不安全,安全层对 RL 智能体施加惩罚,并将其替换为最接近的安全动作。在仿真中,我们表明该方法在 Gazebo 中的 Turtlebot 3 与 Unreal Engine 4(UE4)中的四旋翼机器人导航问题上优于最先进的安全 RL 方法。
引用
@article{arxiv.2211.11027,
title = {Safe Reinforcement Learning using Data-Driven Predictive Control},
author = {Mahmoud Selim and Amr Alanwar and M. Watheq El-Kharashi and Hazem M. Abbas and Karl H. Johansson},
journal= {arXiv preprint arXiv:2211.11027},
year = {2022}
}