中文

多动作 MDP 上策略迭代的下界

机器学习 2020-09-18 v1 最优化与控制 机器学习

摘要

策略迭代(PI)是一类经典算法,用于计算任意给定马尔可夫决策问题(MDP)的最优策略。PI 的基本思想是从某个初始策略出发,反复将策略更新为来自改进集合中的一个策略,直至达到最优策略。PI 的不同变体源于用于改进的(切换)规则。一个重要的理论问题是,作为输入 MDP 中状态数 nn 与动作数 kk 的函数,特定 PI 变体将花费多少次迭代终止。尽管在给出该次数的上界方面已取得相当进展,关于下界的结果却较少。特别地,现有下界主要关注 k=2k = 2 动作这一特殊情况。我们设计了 k3k \geq 3 时的下界。我们的主要结果是,特定 PI 变体可能花费 Ω(kn/2)\Omega(k^{n/2}) 次迭代终止。我们还将已有的 22 动作 MDP 构造推广,使某些常见确定性 PI 变体的下界放大 kk 倍,并使相应随机化变体的下界放大 log(k)\log(k) 倍。

关键词

引用

@article{arxiv.2009.07842,
  title  = {Lower Bounds for Policy Iteration on Multi-action MDPs},
  author = {Kumar Ashutosh and Sarthak Consul and Bhishma Dedhia and Parthasarathi Khirwadkar and Sahil Shah and Shivaram Kalyanakrishnan},
  journal= {arXiv preprint arXiv:2009.07842},
  year   = {2020}
}

备注

8 pages, 3 diagrams, 2 tables. Paper in IEEE CDC 2020