巡逻安全游戏:应对攻击时间、位置与持续时间自由的对手
人工智能
2024-10-22 v1 计算机科学与博弈论
机器人学
摘要
我们探讨了巡逻安全游戏(Patrol Security Game,PSG),这是一种以深度形式斯塔克伯格博弈建模的机器人巡逻问题,其中攻击者决定其攻击的时机、位置和持续时间。我们的目标是制定一个具有无限时间范围内的巡逻计划,以最小化攻击者的收益。我们证明了PSG可转化为一个具有闭式目标函数的组合博弈问题。通过将防御者的策略限制为时齐性的一阶马尔可夫链(即巡逻者的下一步仅取决于其当前位置),我们证明了在零惩罚情形下,最优解要么最小化预期到达时间,要么最小化返回时间,具体取决于攻击者模型,并且这些解可以高效计算。此外,我们观察到,在高惩罚情形下,增加巡逻计划的随机性会降低攻击者的预期收益。然而,在其他情形下,博弈问题变得非凸。为此,我们构建了一个包含两个目标——期望最大奖励和熵——的双准则优化问题。我们提出了三个基于图的算法和一个深度强化学习模型,旨在高效地平衡这两个目标之间的权衡。值得注意的是,第三种算法能够识别最优的确定性巡逻计划,尽管其运行时间随巡逻点数量而指数增长。实验结果验证了我们解决方案的有效性和可扩展性,表明我们的做法在合成数据和真实世界犯罪数据集上均优于最先进的基线方法。
引用
@article{arxiv.2410.15600,
title = {Patrol Security Game: Defending Against Adversary with Freedom in Attack Timing, Location, and Duration},
author = {Hao-Tsung Yang and Ting-Kai Weng and Ting-Yu Chang and Kin Sum Liu and Shan Lin and Jie Gao and Shih-Yu Tsai},
journal= {arXiv preprint arXiv:2410.15600},
year = {2024}
}
备注
Under review of TCPS