中文

强化学习在追逃微分博弈中的安全性、稳定性与鲁棒性

系统与控制 2025-07-29 v1 系统与控制

摘要

在障碍物密集的环境中,安全性和稳定性是追逃(pursuit-evasion, PE)问题的两个关键考量。现有大多数研究结合控制障碍函数(control barrier functions, CBFs)与强化学习(reinforcement learning, RL)以提供高效且安全的解决方案。然而,它们未考虑许多实际应用中可能存在的扰动,如阵风和执行器故障。本文将 CBFs 与滑模控制(sliding mode control, SMC)项集成到 RL 中,以同时解决安全性、稳定性以及对扰动的鲁棒性。然而,由于 CBF 与 SMC 项之间的强耦合,这种集成极具挑战性。受 Stackelberg 博弈启发,我们提出一种分层设计方案来处理耦合问题,其中 SMC 与安全控制项以领导者-跟随者的方式相互作用。具体而言,作为领导者的 CBF 控制器独立于 SMC 设计来保证安全性;而作为跟随者的 SMC 项则基于 CBF 控制器进行设计。随后,我们将 PE 问题表述为零和博弈,并提出一种安全鲁棒 RL 框架以在线学习极小极大策略。我们给出了一个充分条件,在此条件下即使约束发生冲突,所提算法依然有效。仿真结果证明了所提安全鲁棒 RL 框架的有效性。

关键词

引用

@article{arxiv.2507.19516,
  title  = {Reinforcement learning in pursuit-evasion differential game: safety, stability and robustness},
  author = {Xinyang Wang and Hongwei Zhang and Jun Xu and Shimin Wang and Martin Guay},
  journal= {arXiv preprint arXiv:2507.19516},
  year   = {2025}
}

备注

13 pages, 7 figures