中文

简单策略迭代下界的分析

机器学习 2019-12-02 v1 最优化与控制 机器学习

摘要

策略迭代是一类用于为给定马尔可夫决策问题(MDP)寻找最优策略的算法。简单策略迭代(SPI)是一种策略迭代,其策略是在每一步恰好在一个可改进状态处改变策略。Melekopoglou 与 Condon [1990] 给出了 SPI 在 2 动作 MDP 上迭代次数的指数下界。此后该结果未被推广到 kk-动作 MDP。本文中,我们重新审视 Melekopoglou 与 Condon 的算法与分析。我们推广了先前的结果,并证明了策略迭代在 NN-状态、kk-动作 MDP 上迭代次数的一个新指数下界。我们构造了一族 MDP,并给出了一种基于索引的切换规则,其产生了 O((3+k)2N/23)\mathcal{O}\big((3+k)2^{N/2-3}\big) 的强下界。

关键词

引用

@article{arxiv.1911.12842,
  title  = {Analysis of Lower Bounds for Simple Policy Iteration},
  author = {Sarthak Consul and Bhishma Dedhia and Kumar Ashutosh and Parthasarathi Khirwadkar},
  journal= {arXiv preprint arXiv:1911.12842},
  year   = {2019}
}