中文

用于具有时序逻辑目标的欺骗性策略综合的动态超博弈

计算机科学与博弈论 2020-08-03 v1

摘要

本文研究在对抗环境中利用欺骗进行策略规划。我们将智能体(参与者1)与对手(参与者2)之间的交互建模为双人并发博弈,其中对手对智能体时序逻辑任务规范具有不完全信息。在在线交互过程中,对手可从观测中推断智能体意图并调整其策略以阻止智能体满足任务。为针对此类自适应对手进行规划,智能体必须利用其关于对手不完全信息的知识来影响对手行为,从而实施欺骗。为综合欺骗性策略,我们引入一类超博弈模型,其在非对称、不完全信息下刻画智能体与对手的交互。超博弈是智能体与对手感知不同的博弈层次结构。我们发展了该类超博弈的求解概念,并证明智能体的主观可理性化策略具有欺骗性,且最大化了满足时序逻辑任务的概率。该欺骗性策略通过建模对手对交互演化的感知并将对手模型整合进主动规划而获得。遵循欺骗性策略,智能体选择动作以影响博弈历史并操纵对手感知,使其采取有益于智能体目标的动作。我们利用具有时序逻辑目标的机器人运动规划示例证明了欺骗性规划算法的正确性,并设计了一种检测机制以在对手行为建模可能存在错误时通知智能体。

关键词

引用

@article{arxiv.2007.15726,
  title  = {Dynamic Hypergames for Synthesis of Deceptive Strategies with Temporal Logic Objectives},
  author = {Lening Li and Haoxiang Ma and Abhishek N. Kulkarni and Jie Fu},
  journal= {arXiv preprint arXiv:2007.15726},
  year   = {2020}
}

备注

11 pages, 4 figures, submitted to IEEE Transactions on Automation Science and Engineering