面向不完美感知智能体的区间POMDP屏蔽
人工智能
2026-04-23 v1 系统与控制
系统与控制
摘要
依赖学习感知的自主系统在传感器读数被误分类时可能做出不安全的决策。我们研究针对此情况的屏蔽:给定一个拟议的动作,屏蔽器会阻止可能违反安全的动作。我们考虑系统动力学已知但感知不确定性必须从有限标记数据中估计的常见情况。基于这些数据,我们为感知结果的概率构建置信区间,并利用它们将系统建模为一个具有离散状态和动作的有限区间部分可观察马尔可夫决策过程。然后,我们提出了一种算法来计算关于底层状态的一个保守信念集,该集合与迄今为止观察到的观测值一致。这使我们能够构建一个带有有限时域保证的运行时屏蔽器:以高概率,在训练数据上,如果真实的感知不确定性率位于学习到的区间内,那么屏蔽器允许的每个动作都满足规定的安全下限。在四个案例研究上的实验表明,我们的屏蔽方法(及其衍生变体)相比最先进的基线方法提高了系统的安全性。
引用
@article{arxiv.2604.20728,
title = {Interval POMDP Shielding for Imperfect-Perception Agents},
author = {William Scarbro and Ravi Mangal},
journal= {arXiv preprint arXiv:2604.20728},
year = {2026}
}
备注
15 pages, 7 figures