SAFE-GIL:面向机器人系统的安全性引导模仿学习
机器人学
2024-11-20 v2 机器学习
系统与控制
系统与控制
摘要
行为克隆(Behavior Cloning, BC)是模仿学习中广泛使用的方法,机器人通过观察专家监督者来学习控制策略。然而,学习到的策略可能会产生错误并导致安全违规,这限制了其在安全关键型机器人应用中的实用性。尽管已有工作尝试通过额外的真实或合成动作标签、对抗训练或运行时过滤来改进 BC 策略,但均未明确聚焦于在训练阶段减少 BC 策略的安全违规。我们提出 SAFE-GIL,一种在设计阶段学习具备安全意识的行为克隆策略的方法。SAFE-GIL 在数据收集过程中故意向系统注入对抗性扰动,以引导专家进入安全关键状态。这种扰动注入模拟了系统在测试阶段可能遇到的潜在策略错误。通过确保训练过程更真实地复现安全关键状态下的专家行为,即使测试阶段存在策略错误,我们的方法仍能产生更安全的策略。我们进一步开发了一种基于可达性的方法来计算这种对抗性扰动。我们在三个领域中将 SAFE-GIL 与多种行为克隆技术和在线安全过滤方法进行了比较:自主地面导航、飞机滑行以及四旋翼测试台上的空中导航。我们的方法显著降低了安全失效,尤其是在数据量较少的场景下,此时学习出错及由此导致安全违规的可能性更高。参见我们的网站:https://y-u-c.github.io/safegil/
引用
@article{arxiv.2404.05249,
title = {SAFE-GIL: SAFEty Guided Imitation Learning for Robotic Systems},
author = {Yusuf Umut Ciftci and Darren Chiu and Zeyuan Feng and Gaurav S. Sukhatme and Somil Bansal},
journal= {arXiv preprint arXiv:2404.05249},
year = {2024}
}