中文

策略迭代对于具有常数折扣因子的双人回合制随机博弈是强多项式时间的

计算机科学与博弈论 2010-08-04 v1

摘要

Ye 最近证明,采用 Dantzig 主元规则的单纯形法以及 Howard 的策略迭代算法,能在强多项式时间内求解具有常数折扣因子的折扣马尔可夫决策过程(MDP)。更精确地说,Ye 证明了两种算法最多在 O(mn1γlog(n1γ))O(\frac{mn}{1-\gamma}\log(\frac{n}{1-\gamma})) 次迭代后终止,其中 nn 是状态数,mm 是 MDP 中的总动作数,0<γ<10<\gamma<1 是折扣因子。我们在两个方面改进了 Ye 的分析。首先,我们改进了 Ye 给出的界,并证明 Howard 的策略迭代算法实际上最多在 O(m1γlog(n1γ))O(\frac{m}{1-\gamma}\log(\frac{n}{1-\gamma})) 次迭代后终止。其次,更重要的是,我们证明相同的界也适用于策略迭代(或策略改进)算法执行的迭代次数,该算法是用于求解具有折扣零和奖励的双人回合制随机博弈的 Howard 策略迭代算法的推广。这为求解这些博弈提供了第一个强多项式时间算法,解决了一个长期存在的开放问题。

关键词

引用

@article{arxiv.1008.0530,
  title  = {Strategy iteration is strongly polynomial for 2-player turn-based stochastic games with a constant discount factor},
  author = {Thomas Dueholm Hansen and Peter Bro Miltersen and Uri Zwick},
  journal= {arXiv preprint arXiv:1008.0530},
  year   = {2010}
}