中文

安全庞特里亚金可微编程

机器学习 2021-10-27 v2 机器人学 系统与控制 系统与控制

摘要

我们提出一种安全庞特里亚金可微编程(Safe PDP)方法,其建立了理论与算法框架以解决广泛的一类安全关键学习与控制任务——这些任务要求在学习与控制进展的任何阶段保证安全约束满足。本着内点法的精神,Safe PDP 通过将状态与输入上的不同类型系统约束经障碍函数纳入代价或损失来处理它们。我们证明了所提 Safe PDP 的三个基础:第一,反向传播中的解及其梯度均可通过求解更高效的无约束对应问题来近似;第二,解与其梯度的近似均可由障碍参数控制至任意精度;第三,重要的是,整个近似与优化过程中的所有中间结果严格遵从约束,从而保障整个学习与控制系统过程的安全。我们在不同挑战性系统(如 6 自由度机动四旋翼与 6 自由度火箭动力着陆)上展示了 Safe PDP 在解决各类安全关键任务中的能力,包括安全策略优化、安全运动规划以及从示范中学习 MPC。

关键词

引用

@article{arxiv.2105.14937,
  title  = {Safe Pontryagin Differentiable Programming},
  author = {Wanxin Jin and Shaoshuai Mou and George J. Pappas},
  journal= {arXiv preprint arXiv:2105.14937},
  year   = {2021}
}

备注

This paper has been accepted by NeurIPS 2021