并发安全博弈的策略改进
计算机科学与博弈论
2008-12-18 v1 计算机科学中的逻辑
摘要
我们考虑在图上进行的并发博弈。在博弈的每一轮中,每个玩家同时且独立地选择一个动作;这些动作共同决定了向后继状态的转移。两个基本目标是安全目标:“永远留在状态集 F 中”,及其对偶目标,可达性目标:“到达状态集 R”。我们在本文中提出了一种策略改进算法,用于计算并发安全博弈的值,即玩家 1 能保证实现安全目标的最大概率。该算法生成一系列玩家 1 的策略,这些策略确保的获胜概率单调收敛于安全博弈的值。该结果的意义有两方面。首先,虽然策略改进算法已为 Markov 决策过程和回合制博弈以及并发可达性博弈所知,但这是首个用于并发安全博弈的策略改进算法。其次,也是最重要的,该改进算法提供了一种从下方逼近并发安全博弈值的方法(已知的价值迭代算法从上方逼近该值)。因此,当与价值迭代算法或用于可达性博弈的策略改进算法结合使用时,我们的算法构成了首个实用算法,能够计算可达性博弈和安全博弈值的收敛上限和下限。
关键词
引用
@article{arxiv.0804.4530,
title = {Strategy Improvement for Concurrent Safety Games},
author = {Krishnendu Chatterjee and Luca de Alfaro and Thomas A. Henzinger},
journal= {arXiv preprint arXiv:0804.4530},
year = {2008}
}
备注
19 pages, 1 figure