中文

V-OCBF:基于价值引导的离线控制屏障函数

人工智能 2026-04-03 v2 机器人学

摘要

确保自动系统的安全性需要控制器能够在不依赖在线交互的情况下满足状态级约束。虽然现有的安全离线RL方法通常强制执行软期望成本约束,但难以确保严格的状态级安全性。相反,控制屏障函数(CBF)提供了一种原则化的方法来实现前向不变性,但往往依赖于专家设计的屏障函数或系统动力学知识。我们引入价值引导的离线控制屏障函数(V-OCBF),该框架可从离线演示中完全学习神经网络CBF。不同于先前方法,V-OCBF不假设访问动力学模型;相反,它推导出一种递归有限差分屏障更新,实现无模型的屏障学习,使其能够随时间传递安全信息。此外,V-OCBF采用期望分位方法,避免在分布外动作上查询屏障,并限制更新受数据集支持的动作集合。所学得的屏障随后用于二次规划(QP)公式来综合实时安全控制。经过多个案例研究,V-OCBF在保持强任务性能的同时,比基线方法显著减少了安全违规,凸显其在无需在线交互或人工设计屏障的情况下,大规模离线安全控制合成的可扩展性。

关键词

引用

@article{arxiv.2512.10822,
  title  = {V-OCBF: Learning Safety Filters from Offline Data via Value-Guided Offline Control Barrier Functions},
  author = {Mumuksh Tayal and Manan Tayal and Aditya Singh and Shishir Kolathaya and Ravi Prakash},
  journal= {arXiv preprint arXiv:2512.10822},
  year   = {2026}
}

备注

28 pages, 9 figures, 11 tables. Paper accepted at TMLR