简单策略迭代下界的分析
机器学习
2019-12-02 v1 最优化与控制
机器学习
摘要
策略迭代是一类用于为给定马尔可夫决策问题(MDP)寻找最优策略的算法。简单策略迭代(SPI)是一种策略迭代,其策略是在每一步恰好在一个可改进状态处改变策略。Melekopoglou 与 Condon [1990] 给出了 SPI 在 2 动作 MDP 上迭代次数的指数下界。此后该结果未被推广到 动作 MDP。本文中,我们重新审视 Melekopoglou 与 Condon 的算法与分析。我们推广了先前的结果,并证明了策略迭代在 状态、动作 MDP 上迭代次数的一个新指数下界。我们构造了一族 MDP,并给出了一种基于索引的切换规则,其产生了 的强下界。
引用
@article{arxiv.1911.12842,
title = {Analysis of Lower Bounds for Simple Policy Iteration},
author = {Sarthak Consul and Bhishma Dedhia and Kumar Ashutosh and Parthasarathi Khirwadkar},
journal= {arXiv preprint arXiv:1911.12842},
year = {2019}
}