中文

具有神经感知机制的 POMDP 的基于点的价值迭代

系统与控制 2024-08-08 v2 人工智能 系统与控制

摘要

在安全关键场景中集成神经网络与传统软件组件的趋势日益增长,这要求发展用于其形式化建模、验证以及构造即正确策略综合的方法。我们引入了神经符号部分可观测马尔可夫决策过程(NS-POMDP),这是一类具有离散观测与动作的连续状态 POMDP 变体,其中智能体使用神经{\revise 感知机制}感知连续状态环境并以符号方式决策。该感知机制将图像与传感器值等输入分类为符号感知,用于决策。我们研究 NS-POMDP 的折扣累积奖励优化问题。直接在连续状态空间上工作,我们利用模型与神经感知机制的底层结构,提出一种基于覆盖状态空间的多面体与值向量的新型分段线性凸表示(P-PWLC),并将贝尔曼备份推广到该表示。我们证明了值函数的凸性与连续性,并给出两种确保有限可表示性的价值迭代算法。第一种是经典(精确)价值迭代算法,将 Porta 等人(2006)的 α\alpha 函数推广到连续状态空间的 P-PWLC 表示。第二种是一种称为 NS-HSVI 的基于点(近似)方法,其利用 P-PWLC 表示及信念值诱导函数,对粒子基与区域基两类信念从下方与上方逼近值函数。借助原型实现,我们在两个采用(训练好的)ReLU 神经网络作为感知函数的案例研究上展示了方法的实际适用性,综合出(近似)最优策略。

关键词

引用

@article{arxiv.2306.17639,
  title  = {Point-Based Value Iteration for POMDPs with Neural Perception Mechanisms},
  author = {Rui Yan and Gabriel Santos and Gethin Norman and David Parker and Marta Kwiatkowska},
  journal= {arXiv preprint arXiv:2306.17639},
  year   = {2024}
}

备注

65 pages, 14 figures