中文

策略迭代复杂度的改进与广义上界

最优化与控制 2016-02-11 v4 人工智能 离散数学 机器人学

摘要

给定一个具有 nn 个状态和总动作数 mm 的马尔可夫决策过程 (MDP),我们研究了策略迭代 (PI) 算法收敛到最优 γ\gamma-折扣策略所需的迭代次数。我们考虑了两种 PI 变体:Howard's PI,它改变所有具有正优势的状态中的动作;以及 Simplex-PI,它仅改变具有最大优势的状态中的动作。我们证明 Howard's PI 最多在 O(m1γlog(11γ))O\left(\frac{m}{1-\gamma}\log\left(\frac{1}{1-\gamma}\right)\right) 次迭代后终止,将 Hansen 等人的结果改进了 O(logn)O(\log n) 倍;而 Simplex-PI 最多在 O(nm1γlog(11γ))O\left(\frac{nm}{1-\gamma}\log\left(\frac{1}{1-\gamma}\right)\right) 次迭代后终止,将 Ye 的结果改进了 O(logn)O(\log n) 倍。在 MDP 的某些结构性质下,我们随后考虑了独立于折扣因子 γ\gamma 的界:感兴趣的量是界 τt\tau_tτr\tau_r——它们对所有状态和策略一致——分别针对从均匀分布开始时在瞬态状态中的期望停留时间,以及在常返状态中访问频率的倒数。事实上,我们证明 Simplex-PI 最多在 O~(n3m2τtτr)\tilde O\left(n^3 m^2 \tau_t \tau_r \right) 次迭代后终止。这扩展了 Post 和 Ye 针对确定性 MDP 的近期结果(其中 τt1\tau_t\le 1τrn\tau_r \le n),特别是表明 Simplex-PI 对于更大类的 MDP 是强多项式的。我们解释了为何类似的结果似乎难以针对 Howard's PI 推导。最后,在额外的(限制性)假设下,即状态空间被划分为两个集合,分别是对所有策略均为瞬态和常返的状态,我们证明 Howard's PI 和 Simplex-PI 均在最多 O~(m(n2τt+nτr))\tilde O(m(n^2\tau_t+n\tau_r)) 次迭代后终止。

关键词

引用

@article{arxiv.1306.0386,
  title  = {Improved and Generalized Upper Bounds on the Complexity of Policy Iteration},
  author = {Bruno Scherrer},
  journal= {arXiv preprint arXiv:1306.0386},
  year   = {2016}
}

备注

Markov decision processes, Dynamic Programming, Analysis of Algorithms, Mathematics of Operations Research, INFORMS, 2016