策略迭代复杂度的改进与广义上界
最优化与控制
2016-02-11 v4 人工智能
离散数学
机器人学
摘要
给定一个具有 个状态和总动作数 的马尔可夫决策过程 (MDP),我们研究了策略迭代 (PI) 算法收敛到最优 -折扣策略所需的迭代次数。我们考虑了两种 PI 变体:Howard's PI,它改变所有具有正优势的状态中的动作;以及 Simplex-PI,它仅改变具有最大优势的状态中的动作。我们证明 Howard's PI 最多在 次迭代后终止,将 Hansen 等人的结果改进了 倍;而 Simplex-PI 最多在 次迭代后终止,将 Ye 的结果改进了 倍。在 MDP 的某些结构性质下,我们随后考虑了独立于折扣因子 的界:感兴趣的量是界 和 ——它们对所有状态和策略一致——分别针对从均匀分布开始时在瞬态状态中的期望停留时间,以及在常返状态中访问频率的倒数。事实上,我们证明 Simplex-PI 最多在 次迭代后终止。这扩展了 Post 和 Ye 针对确定性 MDP 的近期结果(其中 且 ),特别是表明 Simplex-PI 对于更大类的 MDP 是强多项式的。我们解释了为何类似的结果似乎难以针对 Howard's PI 推导。最后,在额外的(限制性)假设下,即状态空间被划分为两个集合,分别是对所有策略均为瞬态和常返的状态,我们证明 Howard's PI 和 Simplex-PI 均在最多 次迭代后终止。
引用
@article{arxiv.1306.0386,
title = {Improved and Generalized Upper Bounds on the Complexity of Policy Iteration},
author = {Bruno Scherrer},
journal= {arXiv preprint arXiv:1306.0386},
year = {2016}
}
备注
Markov decision processes, Dynamic Programming, Analysis of Algorithms, Mathematics of Operations Research, INFORMS, 2016