中文

通过非压缩二元 Bellman 算子学习安全评论家

机器学习 2024-01-24 v1 系统与控制 系统与控制

摘要

在强化学习(RL)中无法自然地以有限失败次数来保证安全性,是阻碍其在现实世界应用中使用的核心挑战。具有极大实用价值的一种安全性概念是避免状态空间中(不安全)区域的能力。尽管此类安全目标可由类似动作价值函数的函数(即安全评论家)来刻画,但相关的算子缺乏经典 Bellman 算子所具有的期望压缩性与唯一性。在本工作中,我们利用安全性是二元属性这一特点,克服了安全评论家算子的非压缩性。为此,我们研究了与旨在避免到达不安全区域的确定性动力系统相关的二元安全评论家的性质。我们为安全性构建了相应的二元 Bellman 方程(B2E)并研究了其性质。虽然所得算子仍是非压缩的,但我们完全刻画了其不动点,这些不动点——除虚假解外——代表了状态空间中能够始终避免失败的最大持续安全区域。我们提供了一种算法,该算法在设计上利用安全数据的公理知识以避免虚假不动点。

关键词

引用

@article{arxiv.2401.12849,
  title  = {Learning safety critics via a non-contractive binary bellman operator},
  author = {Agustin Castellano and Hancheng Min and Juan Andrés Bazerque and Enrique Mallada},
  journal= {arXiv preprint arXiv:2401.12849},
  year   = {2024}
}