中文

有限时域马尔可夫决策过程与简单随机博弈的策略复杂性

计算机科学与博弈论 2012-09-18 v1

摘要

马尔可夫决策过程 (MDP) 和简单随机博弈 (SSG) 为研究与概率系统相关的许多重要问题提供了丰富的数学框架。具有有限时域目标的 MDP 和 SSG(其目标是在给定的有限时间内最大化到达目标状态的概率)是一个经典且被广泛研究的问题。在本文中,我们考虑有限时域 MDP 和 SSG 的策略复杂性。我们表明,对于所有 ϵ>0\epsilon>0,自然的基于计数器的策略类最多需要 loglog(1ϵ)+n+1\log \log (\frac{1}{\epsilon}) + n+1 个记忆状态,并且需要大小为 Ω(loglog(1ϵ)+n)\Omega(\log \log (\frac{1}{\epsilon}) + n) 的记忆。因此,我们的界限是渐近最优的。随后,我们研究了最优策略的周期性性质,并证明了最优策略周期的次指数下界。

关键词

引用

@article{arxiv.1209.3617,
  title  = {Strategy complexity of finite-horizon Markov decision processes and simple stochastic games},
  author = {Krishnendu Chatterjee and Rasmus Ibsen-Jensen},
  journal= {arXiv preprint arXiv:1209.3617},
  year   = {2012}
}