中文

对称策略改进的最坏情况复杂度

计算机科学与博弈论 2023-09-06 v1

摘要

对称策略改进是由 Schewe 等人(ICALP 2015)提出的一种算法,可用于求解有向图上的双人博弈,如奇偶性博弈和平均收益博弈。与众所周知的通常策略改进算法不同,它同时迭代两名玩家的策略。对称版本能快速求解已知的策略改进最坏情况实例,但其最坏情况复杂度一直未明。我们提出了一类对称策略改进的最坏情况实例,在该类实例上此对称版本同样需要指数多步。值得注意的是,我们的实例对任意改进规则的选择都表现出这一行为,这与经典策略改进形成对比——后者中的困难实例通常针对特定改进规则手工构造。我们提出了一种对称策略迭代的广义版本,其对两名玩家策略相互作用的依赖较不严格。然而,结果表明它存在同样的缺陷。

关键词

引用

@article{arxiv.2309.02223,
  title  = {The Worst-Case Complexity of Symmetric Strategy Improvement},
  author = {Tom van Dijk and Georg Loho and Matthew Maat},
  journal= {arXiv preprint arXiv:2309.02223},
  year   = {2023}
}