中文

ISAACS:用于安全性的迭代软对抗 Actor-Critic 方法

机器学习 2024-06-11 v3 机器人学 系统与控制 系统与控制

摘要

机器人在非受控环境中的部署要求其在先前未见的场景(如不规则地形和风况)下稳健运行。不幸的是,尽管来自鲁棒最优控制理论的严格安全框架难以扩展到高维非线性动力学,但由更易处理的“深度”方法计算出的控制策略缺乏保证,且往往对不确定运行条件表现出很少的鲁棒性。本工作提出了一种新方法,通过将博弈论安全分析与仿真中的对抗式强化学习相结合,实现对具有一般非线性动力学并受有界建模误差影响的机器人系统的可扩展鲁棒安全保持控制器综合。遵循软 actor-critic 方案,一个寻求安全的回退策略与一个对抗式“扰动”智能体共同训练,后者旨在引发设计者不确定性所允许的最坏情形模型误差及训练到部署差异。虽然学到的控制策略本身不保证安全,但它被用于基于前向可达性展开构造具有鲁棒安全保证的实时安全过滤器(或屏蔽)。该屏蔽可与安全无关的控制策略联合使用,排除任何可能导致安全丧失的任务驱动动作。我们在一个 5 维赛车模拟器中评估了基于学习的安全方法,将学到的安全策略与数值求得的最优解进行比较,并实证验证了我们所提安全屏蔽针对最坏情形模型差异的鲁棒安全保证。

关键词

引用

@article{arxiv.2212.03228,
  title  = {ISAACS: Iterative Soft Adversarial Actor-Critic for Safety},
  author = {Kai-Chieh Hsu and Duy Phuong Nguyen and Jaime Fernández Fisac},
  journal= {arXiv preprint arXiv:2212.03228},
  year   = {2024}
}

备注

Accepted in 5th Annual Learning for Dynamics & Control Conference (L4DC), University of Pennsylvania