中文

论多项式规模的 MDP 简洁策略

人工智能 2011-06-27 v1

摘要

马尔可夫决策过程(MDP)的策略根据当前状态以及可能的历史(过去的状态)决定下一步要执行的动作。当状态数量庞大时,通常使用简洁表示以在缩减的空间内紧凑地表示 MDP 及其策略。本文分析了与简洁表示策略规模相关的一些问题。具体而言,本文表明除非多项式层级坍塌,否则某些 MDP 的策略只能以相对于 MDP 规模的超多项式空间来表示。这一事实促使了对判定给定 MDP 是否具有给定规模和奖励的策略问题的研究。由于某些 MDP 算法通过寻找值函数的简洁表示来工作,因此判定是否存在具有给定规模和奖励的值函数简洁表示的问题也得到了考虑。

关键词

引用

@article{arxiv.1106.4866,
  title  = {On Polynomial Sized MDP Succinct Policies},
  author = {P. Liberatore},
  journal= {arXiv preprint arXiv:1106.4866},
  year   = {2011}
}