中文

由护栏引导:将控制屏障函数作为机器人学习中的安全指导员

机器人学 2025-05-27 v1 机器学习

摘要

安全性是阻碍基于学习的机器人系统在日常生活中广泛采用的首要障碍。尽管强化学习 (RL) 作为一种有效的机器人学习范式展现出巨大潜力,但常规的 RL 框架通常通过单一标量负奖励并立即终止 episode 来建模安全性,无法捕捉不安全行为(如持续碰撞损伤)的时间性后果。本文引入一种新方法,通过施加持续的负奖励而不终止 episode 来模拟这些时间性效应。我们的实验表明,标准 RL 方法在面对此模型时困难重重,因为不安全区域累积的负值会形成学习障碍。为此,我们展示了如何利用控制屏障函数 (CBF),其已证明具备安全保障,有效帮助机器人避免灾难性区域,从而提升学习效果。我们提出了三种基于 CBF 的方法,每种方法都将传统 RL 方法与控制屏障函数集成,引导智能体学习安全行为。我们在仿真环境和实际环境中使用四轮差动驱动机器人进行的经验分析,探讨了这些方法可用于安全机器人学习的可能性。

关键词

引用

@article{arxiv.2505.18858,
  title  = {Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning},
  author = {Maeva Guerrier and Karthik Soma and Hassan Fouad and Giovanni Beltrame},
  journal= {arXiv preprint arXiv:2505.18858},
  year   = {2025}
}