中文

马尔可夫决策过程策略迭代的平滑复杂度

计算复杂性 2022-12-02 v1 计算机科学与博弈论

摘要

我们证明了马尔可夫决策过程经典的 Howard 策略迭代算法的平滑复杂度存在次指数级下界(即 2Ω(nc)2^{\Omega (n^c)})。该下界对总奖励准则和平均奖励准则均成立。该构造具有鲁棒性,即次指数级下界不仅在 MDP 参数(转移概率和奖励)的独立随机扰动平均意义下成立,而且对逆多项式范围内的任意扰动均成立。对于简单的可达性目标,我们还证明了其最坏情况复杂度存在指数级下界。

关键词

引用

@article{arxiv.2212.00083,
  title  = {The Smoothed Complexity of Policy Iteration for Markov Decision Processes},
  author = {Miranda Christ and Mihalis Yannakakis},
  journal= {arXiv preprint arXiv:2212.00083},
  year   = {2022}
}