基于扰动观察器的控制屏障函数及残差模型学习用于安全强化学习
机器人学
2024-10-10 v1
摘要
强化学习 (RL) 智能体需要探索其环境以学习最优行为并实现最大奖励。然而,在真实系统上直接进行 RL 训练时,探索可能具有风险,而仿真训练则引入了仿真-现实鸿沟的棘手问题。最近的研究方法利用安全过滤器(如控制屏障函数, CBF)来惩罚 RL 训练中的不安全动作。然而,CBF 的强安全保证依赖于精确的动态模型。实际情况下,总会存在不确定性,包括来自动态模型误差的内部扰动以及诸如风力等外部扰动。本文提出了一种基于扰动抑制加固学习的新型安全 RL 框架,允许几乎无模型的 RL,尽管假设存在但不一定精确的名义动态模型。我们在 Safety-gym 基准测试中对 Point 和 Car 机器人的所有任务进行了验证,其中我们能够超越仅使用残差模型学习或扰动观察器 (DOB) 的最新方法。我们进一步通过物理 F1/10 � racing car 验证了该框架的有效性。视频链接: https://sites.google.com/view/res-dob-cbf-rl
引用
@article{arxiv.2410.06570,
title = {Disturbance Observer-based Control Barrier Functions with Residual Model Learning for Safe Reinforcement Learning},
author = {Dvij Kalaria and Qin Lin and John M. Dolan},
journal= {arXiv preprint arXiv:2410.06570},
year = {2024}
}