中文

面向概率神经网络 dynamics 的不确定性感知预测安全过滤器

机器学习 2026-05-22 v2 系统与控制 系统与控制

摘要

预测安全过滤器(PSF)利用模型预测控制在深度强化学习探索期间强制执行约束满足,但其对第一性原理模型或高斯过程的依赖限制了可扩展性和更广泛的适用性。与此同时,基于模型的强化学习(MBRL)方法通常使用概率集合(PE)神经网络从数据中以最小先验知识捕获复杂的高维 dynamics。然而,现有尝试将PE集成到PSF中缺乏严格的不确定性量化。我们引入不确定性感知预测安全过滤器(UPSi),这是一种PSF,通过将未来结果形式化为可达集,为PE dynamics模型提供严格的安全预测。UPSi引入显式的确定性约束,防止模型滥用,并无缝集成到常见的MBRL框架中。在标准安全RL基准测试中,我们在Dyna式MBRL中评估UPSi,报告在先前神经网络PSF的探索安全性方面显著提高,同时保持与标准MBRL相当的性能。UPSi桥接了现代MBRL的可扩展性和通用性与预测安全过滤器的安全保证之间的鸿沟。

关键词

引用

@article{arxiv.2604.26836,
  title  = {Uncertainty-Aware Predictive Safety Filters for Probabilistic Neural Network Dynamics},
  author = {Bernd Frauenknecht and Lukas Kesper and Daniel Mayfrank and Henrik Hose and Sebastian Trimpe},
  journal= {arXiv preprint arXiv:2604.26836},
  year   = {2026}
}