强化学习在追逃微分博弈中的安全性、稳定性与鲁棒性
系统与控制
2025-07-29 v1 系统与控制
摘要
在障碍物密集的环境中,安全性和稳定性是追逃(pursuit-evasion, PE)问题的两个关键考量。现有大多数研究结合控制障碍函数(control barrier functions, CBFs)与强化学习(reinforcement learning, RL)以提供高效且安全的解决方案。然而,它们未考虑许多实际应用中可能存在的扰动,如阵风和执行器故障。本文将 CBFs 与滑模控制(sliding mode control, SMC)项集成到 RL 中,以同时解决安全性、稳定性以及对扰动的鲁棒性。然而,由于 CBF 与 SMC 项之间的强耦合,这种集成极具挑战性。受 Stackelberg 博弈启发,我们提出一种分层设计方案来处理耦合问题,其中 SMC 与安全控制项以领导者-跟随者的方式相互作用。具体而言,作为领导者的 CBF 控制器独立于 SMC 设计来保证安全性;而作为跟随者的 SMC 项则基于 CBF 控制器进行设计。随后,我们将 PE 问题表述为零和博弈,并提出一种安全鲁棒 RL 框架以在线学习极小极大策略。我们给出了一个充分条件,在此条件下即使约束发生冲突,所提算法依然有效。仿真结果证明了所提安全鲁棒 RL 框架的有效性。
引用
@article{arxiv.2507.19516,
title = {Reinforcement learning in pursuit-evasion differential game: safety, stability and robustness},
author = {Xinyang Wang and Hongwei Zhang and Jun Xu and Shimin Wang and Martin Guay},
journal= {arXiv preprint arXiv:2507.19516},
year = {2025}
}
备注
13 pages, 7 figures