中文

以被动性为中心的接触丰富机器人任务安全强化学习

机器人学 2025-06-13 v2

摘要

强化学习(RL)在各种机器人任务中取得了显著成功;然而,其在现实世界场景中的部署,特别是在接触丰富的环境中,往往忽视了关键的安全性和稳定性方面。缺乏被动性保证的策略可能导致系统不稳定,对机器人、其环境和人类操作员构成风险。在本工作中,我们研究了传统RL策略在部署于接触丰富任务时的局限性,并探索了基于能量的被动控制与安全RL在训练和部署中的结合,以应对这些挑战。首先,我们揭示了标准RL策略在接触丰富场景中不满足稳定性的发现。其次,我们引入了一种基于能量约束的被动感知RL策略训练,纳入我们的安全RL公式中。最后,在部署阶段对策略输出施加被动性滤波器以实现被动性保证的控制。我们在接触丰富的机器人迷宫探索任务上进行了比较研究,评估了学习被动感知策略的效果以及被动性保证控制的重要性。实验表明,即使被动性无关的RL策略在训练中实现了高任务完成度,它在部署中也容易违反能量约束。结果表明,我们提出的方法通过被动性滤波保证了控制稳定性,并通过被动感知训练提高了能量效率。真实世界实验的视频可作为补充材料提供。我们还在Hugging Face上发布了检查点模型和预训练的离线数据。

关键词

引用

@article{arxiv.2503.00287,
  title  = {Passivity-Centric Safe Reinforcement Learning for Contact-Rich Robotic Tasks},
  author = {Heng Zhang and Gokhan Solak and Sebastian Hjorth and Arash Ajoudani},
  journal= {arXiv preprint arXiv:2503.00287},
  year   = {2025}
}

备注

revision version