贝叶斯神经网络的概率可达-回避
机器学习
2023-10-04 v1 人工智能
摘要
基于模型的强化学习旨在同时学习未知随机环境的动力学并综合作用于其中的最优策略。在此类环境中通过策略做出的序贯决策的安全性与鲁棒性,是面向安全关键场景策略的关键挑战。本工作中,我们研究两个互补问题:第一,计算用动力学模型进行迭代预测的可达-回避概率,其中动力学由贝叶斯神经网络(BNN)描述;第二,综合相对于给定可达-回避规范(到达“目标”状态,同时避开一组“不安全”状态)与所学 BNN 模型最优的控制策略。我们的解法利用区间传播与反向递归技术,计算策略动作序列导致满足可达-回避规范的概率下界。此类计算所得下界为该给定策略与 BNN 模型提供安全认证。我们随后引入控制综合算法以推导最大化上述安全性概率下界的策略。我们在一系列以所学 BNN 动力学模型为特征的控制基准上展示了方法的有效性。在最具挑战性的基准上,相较于纯数据驱动策略,最优综合算法可使可认证状态数量增加四倍以上,平均保证可达-回避概率增加三倍以上。
引用
@article{arxiv.2310.01951,
title = {Probabilistic Reach-Avoid for Bayesian Neural Networks},
author = {Matthew Wicker and Luca Laurenti and Andrea Patane and Nicola Paoletti and Alessandro Abate and Marta Kwiatkowska},
journal= {arXiv preprint arXiv:2310.01951},
year = {2023}
}
备注
47 pages, 10 figures. arXiv admin note: text overlap with arXiv:2105.10134