动作误感知可达性博弈中欺骗性策略的综合(技术报告)
计算机科学与博弈论
2021-04-26 v1 形式语言与自动机理论
摘要
战略性欺骗是一种操纵对手感知以获取战略优势的行为。在本文中,我们研究在具有动作集单侧不完全信息的图上双人轮流零和可达性博弈中欺骗性获胜策略的综合。特别地,我们考虑这样一类博弈:玩家 1(P1)起始拥有一组非空私有动作,其可在博弈过程中向玩家 2(P2)‘揭示’。P2 配备一种推断机制,每当有新动作被揭示时,他据此更新对 P1 动作集的感知。在此信息结构下,P1 的目标是到达博弈图中的一组目标状态,而 P2 的目标是阻止之。我们探讨如下问题:P1 如何利用其信息优势欺骗 P2 选择转而有利于 P1 的动作?为此,我们引入一种动态超博弈模型以刻画具有 P2 不断演化误感知的可达性博弈。通过对博弈的定性分析,我们设计算法综合欺骗性必然获胜与几乎必然获胜区域,并建立两个关键结果:(1)在必然获胜条件下,欺骗性获胜策略等价于非欺骗性获胜策略——即使用欺骗无优势;(2)在几乎必然获胜条件下,欺骗性获胜策略可能强于非欺骗性策略。我们使用夺旗游戏阐释算法,并展示所提方法在具有时序逻辑目标的更广义博弈类中的应用。
引用
@article{arxiv.2104.11676,
title = {Synthesis of Deceptive Strategies in Reachability Games with Action Misperception (Technical Report)},
author = {Abhishek N. Kulkarni and Jie Fu},
journal= {arXiv preprint arXiv:2104.11676},
year = {2021}
}
备注
40 pages, 6 figures, under review Journal of AI Research (JAIR)