中文

零和类神经符号并发随机博弈的策略综合

人工智能 2024-07-12 v7 计算机科学与博弈论 计算机科学中的逻辑

摘要

结合神经网络与经典符号技术的人工智能类神经符号方法日益突出,亟需形式化方法来推理其正确性。我们提出一种称为类神经符号并发随机博弈(NS-CSGs)的新建模形式,其包含两个概率有限状态智能体在共享连续状态环境中交互。每个智能体使用神经感知机制观察环境,该机制将图像等输入转换为符号感知,并进行符号化决策。我们聚焦于具有 Borel 状态空间的 NS-CSGs 类,并证明了在该类模型的逐段常数限制下零和折扣累积奖励价值函数的存在性与可测性。为计算价值并综合策略,我们首次提出实用的价值迭代(VI)与策略迭代(PI)算法来求解这一连续状态 CSGs 的新子类。这些算法需要由智能体神经感知机制诱导的环境有限分解,并依赖于在 VI 或 PI 下封闭的价值函数与策略的有限抽象表示。首先,我们引入 Borel 可测逐段常数(B-PWC)价值函数表示,将极小极大备份扩展至该表示,并提出称为 B-PWC VI 的价值迭代算法。其次,我们为价值函数与策略分别引入两种新表示:常数-分段线性(CON-PWL)与常数-分段常数(CON-PWC),并通过将近期基于有限状态空间交替玩家选择的 PI 方法扩展至 Borel 状态空间,提出 Minimax-action-free PI,其无需求解正规形式博弈。

关键词

引用

@article{arxiv.2202.06255,
  title  = {Strategy Synthesis for Zero-Sum Neuro-Symbolic Concurrent Stochastic Games},
  author = {Rui Yan and Gabriel Santos and Gethin Norman and David Parker and Marta Kwiatkowska},
  journal= {arXiv preprint arXiv:2202.06255},
  year   = {2024}
}

备注

58 pages, 7 figures