SHIELD:基于学习动力学期望满足控制屏障函数的人形机器人安全框架
机器人学
2025-08-04 v2
摘要
机器人学习已为复杂任务(例如人形机器人的动态运动)生成了极为有效的“黑箱”控制器。然而,确保此类策略的动态安全性(即约束满足)仍然具有挑战性。强化学习(RL)通过奖励工程启发式地嵌入约束,而添加或修改约束则需要重新训练。基于模型的方法,如控制屏障函数(CBF),能够在运行时指定约束并提供形式化保证,但需要精确的动力学模型。本文提出了 SHIELD,一个分层安全框架,通过以下方式弥合这一差距:(1) 使用来自标称控制器硬件部署的真实世界数据,训练一个生成式随机动力学残差模型,以捕捉系统行为与不确定性;(2) 在标称(学习到的运动)控制器之上添加一个安全层,该层通过随机离散时间 CBF 公式利用此模型,以概率形式强制执行安全约束。其结果是一个微创安全层,可添加到现有自主堆栈中,以提供平衡风险与性能的概率性安全保证。在 Unitree G1 人形机器人上的硬件实验中,SHIELD 使用标称(未知)RL 控制器和机载感知,在多种室内和室外环境中实现了安全导航(避障)。
引用
@article{arxiv.2505.11494,
title = {SHIELD: Safety on Humanoids via CBFs In Expectation on Learned Dynamics},
author = {Lizhi Yang and Blake Werner and Ryan K. Cosner and David Fridovich-Keil and Preston Culbertson and Aaron D. Ames},
journal= {arXiv preprint arXiv:2505.11494},
year = {2025}
}
备注
Video at https://youtu.be/-Qv1wR4jfj4. To appear at IROS 2025