中文

基于鲁棒不变集分解的学习式预测安全滤波器

系统与控制 2023-11-14 v1 机器学习 系统与控制

摘要

在模型不确定性与外部扰动下确保非线性系统的安全至关重要,尤其对于现实控制任务。鲁棒模型预测控制(RMPC)等预测方法需在线求解非凸优化问题,导致高计算负担与较差可扩展性。强化学习(RL)在复杂系统中表现良好,但代价是丧失严格安全保证。本文提出一个理论框架,融合RMPC与RL二者优势,为具有状态与动作依赖不确定性的非线性系统合成安全滤波器。我们将鲁棒不变集(RIS)分解为两部分:与RMPC终端区域设计一致的目标集,以及涵盖RIS其余部分的可达-避障集。我们提出一种针对鲁棒可达-避障问题的策略迭代方法并确立其单调收敛性。该方法为对抗式actor-critic深度RL算法奠定基础,其同时合成可达-避障策略网络、扰动策略网络与可达-避障值网络。所学可达-避障策略网络用于生成标称轨迹以供在线验证,在最坏情形扰动作用下过滤可能将系统驱入不安全区域的潜在不安全动作。我们利用系统级综合提出一种二阶锥规划(SOCP)方法进行在线验证,优化任意可能轨迹的最坏情形可达-避障值。所提安全滤波器较RMPC计算复杂度显著降低,且仍享有持续鲁棒安全保证。通过数值算例说明了方法有效性。

关键词

引用

@article{arxiv.2311.06769,
  title  = {Learning Predictive Safety Filter via Decomposition of Robust Invariant Set},
  author = {Zeyang Li and Chuxiong Hu and Weiye Zhao and Changliu Liu},
  journal= {arXiv preprint arXiv:2311.06769},
  year   = {2023}
}