利用非确定性策略迭代求解奇偶博弈
计算机科学与博弈论
2012-03-20 v4 计算机科学中的逻辑
摘要
本文将通过策略迭代求解奇偶博弈(parity games)的思想扩展到了非确定性策略:在非确定性策略中,玩家在给定节点处将自己限制在某些非空的可能动作子集上,而不是仅限于 exactly one action。我们证明了 Bjoerklund、Sandberg 和 Vorobyov 提出的策略改进算法可以很容易地适应非确定性策略这一更一般的设定。此外,我们证明了应用“所有有利切换”的启发式方法会导致在非确定性策略设定中选择“局部最优”的后继策略,从而为 Schewe 的算法提供了一个简单的证明。与 Bjoerklund 等人的算法不同,我们直接针对奇偶博弈提出了我们的算法,这使得我们能够将其与 Jurdzinski 和 Voege 的算法进行比较:我们证明了在其中一个玩家可以“投降”的奇偶博弈竞技场中,两种算法使用的估值是一致的。因此,我们的算法也可以被视为 Jurdzinski 和 Voege 的算法向非确定性策略的推广。最后,利用非确定性策略,我们证明了改进步骤的数量以 为上界。对于策略改进算法而言,此前已知只有使用随机化才能达到这一界限。
引用
@article{arxiv.0806.2923,
title = {Strategy Iteration using Non-Deterministic Strategies for Solving Parity Games},
author = {Michael Luttenberger},
journal= {arXiv preprint arXiv:0806.2923},
year = {2012}
}