约束流形上的安全强化学习:理论与应用
机器人学
2024-11-07 v2 机器学习
摘要
将基于学习的技术,特别是强化学习,集成到机器人技术中,有望解决非结构化环境中的复杂问题。然而,大多数现有方法在精心调优的模拟器中训练,随后部署到真实机器人上,而无需在线微调。在这种设定下,需要大量的工程工作来弥合从模拟到现实的差距,这对于复杂系统可能极具挑战性。相反,利用真实世界交互数据进行学习提供了一种有前景的替代方案:它不仅消除了对精细调优模拟器的需求,还适用于更广泛的、难以精确建模的任务。在机器人上进行强化学习的一个主要问题是确保安全性,因为不受控制的探索可能对机器人或环境造成灾难性损害。实际上,安全规范通常表示为约束条件,这些约束可能复杂且非线性,使得在学习系统中保证安全性变得困难。在本文中,我们从理论和实践角度展示了如何以一种原则性的方式,为基于学习的机器人系统施加复杂的安全约束。我们的方法基于约束流形的概念,该流形表示安全机器人构型的集合。利用微分几何技术,即切空间,我们可以构建一个安全动作空间,允许学习智能体在确保安全的同时采样任意动作。我们在一个真实世界的机器人空气曲棍球任务中展示了该方法的有效性,表明我们的方法能够处理具有复杂约束的高维任务。真实机器人实验的视频可在项目网站上获取(https://puzeliu.github.io/TRO-ATACOM)。
引用
@article{arxiv.2404.09080,
title = {Safe Reinforcement Learning on the Constraint Manifold: Theory and Applications},
author = {Puze Liu and Haitham Bou-Ammar and Jan Peters and Davide Tateo},
journal= {arXiv preprint arXiv:2404.09080},
year = {2024}
}
备注
19 pages; sumitted to IEEE Transactions on Robotics