中文

基于控制障碍函数的安全逆强化学习

机器人学 2023-03-08 v2 人工智能 机器学习

摘要

示范学习(LfD)是一种使机器人执行新任务的强大方法,因为对于非机器人专家终端用户而言,演示所需技能并让机器人从相关数据高效学习,通常比人工设计奖励函数让机器人通过强化学习(RL)学习技能更可行。现代LfD技术(如逆强化学习(IRL))中会出现安全问题,正如RL一样;然而LfD中的安全学习很少受到关注。在敏捷机器人场景下,由于可能发生机器人与环境碰撞、机器人与人碰撞以及机器人损坏,安全尤为关键。本文提出一种安全IRL框架CBFIRL,利用控制障碍函数(CBF)增强IRL策略的安全性。CBFIRL的核心思想是将受CBF要求启发的损失函数与IRL方法中的目标相结合,二者通过梯度下降联合优化。实验中,我们表明相较无CBF的IRL方法,我们的框架更安全:在2D赛车域两个难度级别上分别有约15%和约20%的提升,在3D无人机域有约50%的提升。

关键词

引用

@article{arxiv.2212.02753,
  title  = {Safe Inverse Reinforcement Learning via Control Barrier Function},
  author = {Yue Yang and Letian Chen and Matthew Gombolay},
  journal= {arXiv preprint arXiv:2212.02753},
  year   = {2023}
}

备注

6 pages, 3 figures