中文

学习满足黑箱系统高相对度约束

系统与控制 2024-07-31 v1 系统与控制

摘要

本文发展了一种方法,用于学习一种控制策略,可保证在与黑箱系统的闭环中满足高相对度的仿射状态约束。以前的强化学习(RL)方法要么需要访问系统模型,要么假设控制仿射动力学,要么仅通过奖励塑造来劝阻违规。最近的工作已通过 POLICEd RL 方法解决了这些问题,保证了对黑箱系统的约束满足。然而,该工作只能强制执行相对度为 1 的约束。为填补这一空白,我们构建了一个新型 RL 算法,专门设计用于在与黑箱控制系统的闭环中强制执行高相对度的仿射状态约束。我们的关键洞察是使所学策略在不安全区域附近为仿射,并利用该仿射区域来消耗高相对度约束的惯性。我们证明了此类策略对确定性系统保证约束满足,而且对 RL 训练算法的选择是中性的。我们的结果表明,该方法具有在 Gym inverted pendulum 和太空飞船着陆仿真中执行硬约束的能力。

关键词

引用

@article{arxiv.2407.20456,
  title  = {Learning to Provably Satisfy High Relative Degree Constraints for Black-Box Systems},
  author = {Jean-Baptiste Bouvier and Kartik Nagpal and Negar Mehr},
  journal= {arXiv preprint arXiv:2407.20456},
  year   = {2024}
}

备注

CDC 2024