通过对抗强化学习合成与部署最大鲁棒控制屏障函数
系统与控制
2026-04-16 v1 机器人学
系统与控制
摘要
鲁棒控制屏障函数(CBFs)提供了一种在最坏情况扰动下平滑安全 enforcement 的原则性方法。然而,现有方法通常依赖于动力学的显式闭式结构(例如:控制仿射形式)和不确定性模型,导致可扩展性和普适性有限,大多数鲁棒CBF仅认证保守的 maximally robust safe set 的子集。本文引入一种针对一般非线性系统的鲁棒CBF框架,适用于有界不确定性。我们首先表明,解决动态编程Isaacs方程的安全值函数是有效的离散时间鲁棒CBF,可确保对maximal robust safe set 的安全性。随后,我们采纳强化学习(RL)中质量函数(或Q函数)的关键概念,通过将障碍证书提升到状态-动作空间,消除对显式动力学的需求,从而得到一种新型鲁棒Q-CBF安全约束。结合对抗RL,该方法实现了针对具有黑盒动力学且不确定性结构未知的一般非线性系统的鲁棒Q-CBF的合成与部署。我们在标准倒摆摆架基准问题和36自由度四足行走机器人仿真器上进行验证,在倒摆摆架上显著降低了保守安全集的保守性,在四足机器人上实现了即使在对抗性不确定性实现下也能可靠地安全 enforcement。
引用
@article{arxiv.2604.13192,
title = {Synthesis and Deployment of Maximal Robust Control Barrier Functions through Adversarial Reinforcement Learning},
author = {Donggeon David Oh and Duy P. Nguyen and Haimin Hu and Jaime Fernández Fisac},
journal= {arXiv preprint arXiv:2604.13192},
year = {2026}
}
备注
8 pages, 2 figures. This work has been submitted to the IEEE for possible publication