中文

SABLAS:面向黑盒动态系统的安全控制学习

机器学习 2022-01-11 v2 人工智能 系统与控制 系统与控制

摘要

基于障碍函数的控制证书已成为为动态系统生成大概率安全控制策略的有力工具。然而,现有基于障碍证书的方法通常针对具有可微动态的白盒系统,这使其不适用于许多系统为黑盒且无法精确建模的实际应用。另一方面,针对黑盒系统的无模型强化学习(RL)方法缺乏安全性保证且采样效率低。本文提出一种新方法,可在无需精确系统模型的情况下为黑盒动态系统学习安全控制策略与障碍证书。我们的方法重新设计损失函数,以在黑盒动态系统不可微时仍能将梯度反向传播至控制策略,并证明安全证书在黑盒系统上成立。仿真经验结果表明,与最先进的黑盒安全控制方法相比,我们的方法通过使用远更少的训练样本实现近100%的安全与目标到达率,显著提升了所学策略的性能。我们学到的智能体还能泛化至未见过场景并保持原有性能。源代码见 https://github.com/Zengyi-Qin/bcbf。

关键词

引用

@article{arxiv.2201.01918,
  title  = {SABLAS: Learning Safe Control for Black-box Dynamical Systems},
  author = {Zengyi Qin and Dawei Sun and Chuchu Fan},
  journal= {arXiv preprint arXiv:2201.01918},
  year   = {2022}
}

备注

IEEE Robotics and Automation Letters, 2022