中文

用于折扣可达成本价值函数的保持可达性的Bellman算子:统一Hamilton-Jacobi可达性与强化学习

系统与控制 2026-07-08 v1

摘要

Hamilton-Jacobi (HJ) 可达性为连续时间动力系统提供了严格的安全性和可达性保证,但其数值解受到维度灾难的影响。相比之下,深度强化学习(DRL)提供了可扩展的基于样本的方法。然而,强化学习通常围绕加性累积奖励构建;而可达性目标本质上是非加性的。这种不匹配使得在HJ可达性和强化学习之间建立直接桥梁变得不简单。最近的折扣公式要么通过改变原始可达性语义来引入压缩,要么在HJ侧保留精确语义而没有相应的Bellman不动点表征。在本文中,我们通过建立在一种保持语义的基于折扣可达的价值函数之上,并推导出一个非加性的Bellman算子,其唯一不动点与HJ公式中的价值函数完全匹配,来弥合这一差距。我们证明了折扣使该算子具有压缩性,从而产生价值迭代的存在性、唯一性和收敛性。此外,我们建立了HJ和Bellman表征之间的等价性,并表明强化学习可以被解释为同一不动点方程的基于样本的近似方案。这在HJ可达性和强化学习之间产生了一种有原则且语义精确的联系,使得基于学习的方法能够近似可达性价值函数,同时保留其安全关键意义。因此,所提出的框架为高维系统中可达集和安全证书的可扩展、数据驱动计算打开了大门。数值实验与HJ解表现出高度一致,通过零水平集的对齐确认了可达性语义的保留,并支持将强化学习解释为所提出Bellman算子的基于样本的求解器。

关键词

引用

@article{arxiv.2607.07893,
  title  = {Reachability-Preserving Bellman Operator for the Discounted Reach-Cost Value Function: Uniting Hamilton-Jacobi Reachability and Reinforcement Learning},
  author = {Isabelle El-Hajj and Prashant Solanki and Jasper van Beers and Coen de Visser and Erik-Jan van Kampen},
  journal= {arXiv preprint arXiv:2607.07893},
  year   = {2026}
}