中文

稳健Koopman控制屏障滤波器:用于安全Actor-Critic强化学习

机器人学 2026-05-27 v1 机器学习 系统与控制 系统与控制

摘要

机器人系统的安全强化学习要求在训练和部署期间满足状态和输入约束的政策。控制屏障函数(CBF)通过最小干扰的安全滤波器实现前向不变性,但其在模型无关强化学习中的应用受限于需要准确的动力学模型和手工设计的屏障证书。我们提出Robust Koopman-CBF SAC,即一种受安全滤波器约束的actor-critic框架,通过数据学习有限维Koopman预测器,在提升空间构建仿射CBF约束,通过二次规划安全层强制执行。为考虑有限维Koopman近似误差,CBF条件通过从持留数据估计的投影残差公边进行紧固。评估网络在执行的安全动作上进行训练,而演化网络则正则化向Koopman-CBF可行集靠拢,减少对滤波器的依赖。跨安全控制基准测试中,该方法在 CartPole 稳定和跟踪任务中实现零约束违例,同时在不受约束的 SAC 返回水平上持平或超越。在高维Safety Gymnasium locomotion 任务中,方法在某些设置下减少了违例,但也暴露了一阶速度屏障和线性EDMD模型的重要局限性,推动了高阶和多步Koopman-CBF的扩展。这些结果表明,稳健Koopman-CBF滤波器是连接模型无关强化学习与可证明安全性的有前景的桥梁,同时阐明了此类滤波器保持有效性的结构条件。所有代码已发布于 Github Repository。

关键词

引用

@article{arxiv.2605.26452,
  title  = {Robust Koopman Control Barrier Filters for Safe Actor-Critic Reinforcement Learning},
  author = {Dhruv S. Kushwaha and Zoleikha A. Biron},
  journal= {arXiv preprint arXiv:2605.26452},
  year   = {2026}
}

备注

17 pages, 7 figures