中文

在保留有效行为的前提下修复学习型控制器

系统与控制 2024-03-15 v2 系统与控制

摘要

学习型控制器已被应用于多种信息物理系统(CPS)中。当学习型控制器无法从一组初始状态完成任务时,研究者利用修复算法来微调控制器的参数。然而,现有修复技术不能保留先前正确的行为。具体而言,当修改参数以修复来自部分初始状态的轨迹时,另一部分初始状态可能受到损害。因此,修复可能破坏先前正确的场景,引入未被考虑的新风险。由于该问题,修复整个初始状态空间可能困难甚至不可行。为此,我们形式化了保留式修复(RwP)问题,要求在修复过程中保留已正确的场景。为解决该问题,我们设计了增量模拟退火修复(ISAR)算法,该算法在带屏障的能量函数上利用模拟退火来保护已正确的初始状态,同时尽可能多地修复额外状态。此外,利用形式化验证来保证修复结果。在一台无人水下航行器(UUV)和 OpenAI Gym Mountain Car(MC)上的案例研究表明,ISAR 不仅保留了先前已验证初始状态区域中的正确行为,还在两个基准中分别修复了 81.4% 和 23.5% 的破损状态空间。此外,ISAR 修复后控制器的平均信号时序逻辑(STL)鲁棒性大于使用基线方法修复的控制器。

关键词

引用

@article{arxiv.2311.03477,
  title  = {Repairing Learning-Enabled Controllers While Preserving What Works},
  author = {Pengyuan Lu and Matthew Cleaveland and Oleg Sokolsky and Insup Lee and Ivan Ruchkin},
  journal= {arXiv preprint arXiv:2311.03477},
  year   = {2024}
}