中文

在可证明安全的强化学习中减少安全干预

机器人学 2023-09-26 v2

摘要

深度强化学习(RL)在解决复杂机器人挑战方面已展现出前景。在真实世界应用中,RL常配备故障保护控制器作为避免灾难性事件的最终手段。尽管对安全必不可少,这些干预可能导致不良行为,如急刹或激进转向。本文提出两种安全干预减少方法:主动替换与主动投影,它们在智能体动作将导致潜在故障保护干预时改变其动作。这些方法在OpenAI安全健身房基准和人机协作任务上与最先进的约束RL进行了比较。我们的研究表明,将我们的方法与可证明安全的RL结合可产生高性能策略,实现零安全违规且故障保护干预次数少。我们通用的方法可应用于广泛的真实世界机器人任务,在有效提升安全性的同时不牺牲任务性能。

关键词

引用

@article{arxiv.2303.03339,
  title  = {Reducing Safety Interventions in Provably Safe Reinforcement Learning},
  author = {Jakob Thumm and Guillaume Pelat and Matthias Althoff},
  journal= {arXiv preprint arXiv:2303.03339},
  year   = {2023}
}

备注

8 pages, 6 figures