多动作 MDP 上策略迭代的下界
机器学习
2020-09-18 v1 最优化与控制
机器学习
摘要
策略迭代(PI)是一类经典算法,用于计算任意给定马尔可夫决策问题(MDP)的最优策略。PI 的基本思想是从某个初始策略出发,反复将策略更新为来自改进集合中的一个策略,直至达到最优策略。PI 的不同变体源于用于改进的(切换)规则。一个重要的理论问题是,作为输入 MDP 中状态数 与动作数 的函数,特定 PI 变体将花费多少次迭代终止。尽管在给出该次数的上界方面已取得相当进展,关于下界的结果却较少。特别地,现有下界主要关注 动作这一特殊情况。我们设计了 时的下界。我们的主要结果是,特定 PI 变体可能花费 次迭代终止。我们还将已有的 动作 MDP 构造推广,使某些常见确定性 PI 变体的下界放大 倍,并使相应随机化变体的下界放大 倍。
引用
@article{arxiv.2009.07842,
title = {Lower Bounds for Policy Iteration on Multi-action MDPs},
author = {Kumar Ashutosh and Sarthak Consul and Bhishma Dedhia and Parthasarathi Khirwadkar and Sahil Shah and Shivaram Kalyanakrishnan},
journal= {arXiv preprint arXiv:2009.07842},
year = {2020}
}
备注
8 pages, 3 diagrams, 2 tables. Paper in IEEE CDC 2020