中文

动作误感知下可达性博弈中欺骗策略的综合

计算机科学与博弈论 2020-07-16 v1 形式语言与自动机理论

摘要

我们考虑一类图上双人轮流零和可达性目标博弈(即可达性博弈),其中玩家1(P1)的目标是到达一组目标状态,而玩家2(P2)的目标是阻止此事。特别地,我们考虑玩家对彼此动作能力具有非对称信息的情况:P2起始时对P1的动作集具有不完全信息(误感知),并在P1使用P2此前未知的动作时更新该误感知。当P1知晓P2的误感知时,关键问题在于P1能否控制P2的感知,从而欺骗P2选择对P1有利的动作?我们表明,可能存在一种欺骗性必胜策略,使得P1从某一原本在信息与完全对称情况下会输的状态以概率1确保达成其目标。我们给出三个关键结果:首先,我们引入动态超博弈模型以刻画具有P2演化误感知的可达性博弈。其次,我们提出一种不动点算法来计算欺骗性几乎必然必胜(DASW)区域与DASW策略。最后,我们表明DASW策略至少与P1不考虑P2误感知的博弈中的几乎必然必胜(ASW)策略同样强大。我们使用对抗环境中的机器人运动规划说明了我们的算法。

关键词

引用

@article{arxiv.2002.07045,
  title  = {Synthesis of Deceptive Strategies in Reachability Games with Action Misperception},
  author = {Abhishek N. Kulkarni and Jie Fu},
  journal= {arXiv preprint arXiv:2002.07045},
  year   = {2020}
}

备注

7 pages, 4 figures, submitted to IJCAI 2020