中文

具有有界首返时间的完全信息随机平均收益博弈的策略迭代是强多项式的

最优化与控制 2013-10-21 v1

摘要

Ye 以及 Hansen、Miltersen 和 Zwick 的最新结果表明,对于具有固定折扣率的单玩家或双玩家(完全信息)零和随机博弈实例,其策略迭代算法是强多项式的。我们证明了,对于平均收益零和随机博弈,若限制在到达给定状态的首次平均返回时间有界的实例上,其策略迭代算法同样是强多项式的。证明基于非线性 Perron-Frobenius 理论的方法,使我们能够将平均收益问题转化为具有状态依赖折扣率的折扣问题。我们的分析还表明,对于折扣问题,若所有策略关联的非负矩阵的谱半径均以某个严格小于 1 的固定常数为上界,则即使在某些状态下折扣率可以是状态依赖的(甚至为负),策略迭代仍保持强多项式性。

关键词

引用

@article{arxiv.1310.4953,
  title  = {Policy iteration for perfect information stochastic mean payoff games with bounded first return times is strongly polynomial},
  author = {Marianne Akian and Stéphane Gaubert},
  journal= {arXiv preprint arXiv:1310.4953},
  year   = {2013}
}

备注

17 pages