面向黑箱混合动力系统的学习控制策略:可证明满足硬性仿射约束
机器人学
2026-04-27 v1
摘要
黑箱混合动力系统的安全性保证面临重大挑战,由于其瞬时状态跳跃以及未知的显式非线性动力学。已有的严格安全约束满足方法(如控制障碍函数 CBF 和可达性分析)依赖于对动力学的直接知识。类似地,安全强化学习(RL)方法常依赖于已知系统动力学,或仅通过奖励塑造来劝阻违反安全约束。在本文中,我们旨在学习能够在黑箱混合动力系统闭环中可证明满足仿射状态约束的 RL 控制策略。我们的关键思想是迫使 RL 策略在约束边界附近保持仿射且排斥,以适应系统未知的非线性动力学,从而保证轨迹不会违反约束。我们进一步通过引入第二个在约束边界前的排斥仿射区域来考虑因冲击或复位映射导致的瞬时状态跳跃所引起的约束违反。我们推导了满足闭环安全约束的充分条件。我们还将方法与最新的奖励塑形和学习 CBF 方法在受限摆锤和飞盘 juggling 等混合动力系统上进行比较。在两种情景下,我们表明该方法能够学习出更高质量的策略,同时始终满足安全约束。
引用
@article{arxiv.2604.22244,
title = {Learning Control Policies to Provably Satisfy Hard Affine Constraints for Black-Box Hybrid Dynamical Systems},
author = {Aayushi Shrivastava and Kartik Nagpal and Sairam Jinkala and Jean-Baptiste Bouvier and Negar Mehr},
journal= {arXiv preprint arXiv:2604.22244},
year = {2026}
}