安全深度策略自适应
机器人学
2024-04-30 v3 人工智能
机器学习
摘要
自主性与人工智能的一个关键目标是使自主机器人能够在动态与不确定环境中快速自适应。经典自适应控制与安全控制提供了稳定性与安全性保证,但局限于特定系统类。相比之下,基于强化学习(RL)的策略自适应提供了通用性与可泛化性,但带来了安全性与鲁棒性挑战。我们提出 SafeDPA,一种新颖的 RL 与控制框架,同时解决策略自适应与安全强化学习问题。SafeDPA 在仿真中联合学习自适应策略与动力学模型,预测环境配置,并利用少样本真实世界数据微调动力学模型。在 RL 策略之上引入基于控制障碍函数(CBF)的安全滤波器,以确保真实世界部署中的安全性。我们提供了 SafeDPA 的理论安全性保证,并展示了 SafeDPA 对学习误差与额外扰动的鲁棒性。在(1)经典控制问题(倒立摆)、(2)仿真基准(Safety Gym)与(3)真实世界敏捷机器人平台(RC Car)上的综合实验表明,SafeDPA 在安全性与任务性能上均优于最先进的基线。特别地,SafeDPA 展现出显著的泛化能力,在真实世界实验中面对未见扰动时,安全性率相比基线提升 300%。
引用
@article{arxiv.2310.08602,
title = {Safe Deep Policy Adaptation},
author = {Wenli Xiao and Tairan He and John Dolan and Guanya Shi},
journal= {arXiv preprint arXiv:2310.08602},
year = {2024}
}
备注
ICRA 2024