中文

Howard 策略迭代对于具有固定比特大小奖励和任意折扣因子的确定性马尔可夫决策问题是次指数的

人工智能 2025-05-05 v1

摘要

Howard 策略迭代(Howard's Policy Iteration, HPI)是解决马尔可夫决策问题(Markov Decision Problems, MDPs)的经典算法。HPI 使用一种“贪婪”切换规则,从任何非最优策略更新到一个占优策略,反复迭代直至找到最优策略。尽管 HPI 引入至今已逾 60 年,但其运行时间的最著名上界在状态数量上仍然是指数级的——即便在仅具有确定性转移的受限 MDP 类(DMDPs)上也是如此。同时,对于每个状态动作数恒定的 MDP,HPI 的最紧下界仅为线性。在本文中,我们报告了一项重大改进:HPI 在 DMDPs 上的一个次指数上界,该上界由奖励的比特大小参数化,且与折扣因子无关。同样的上界也适用于仅有两个可能奖励(其大小可以是任意的)的 DMDPs。

关键词

引用

@article{arxiv.2505.00795,
  title  = {Howard's Policy Iteration is Subexponential for Deterministic Markov Decision Problems with Rewards of Fixed Bit-size and Arbitrary Discount Factor},
  author = {Dibyangshu Mukherjee and Shivaram Kalyanakrishnan},
  journal= {arXiv preprint arXiv:2505.00795},
  year   = {2025}
}