有限时域马尔可夫决策过程与简单随机博弈的策略复杂性
计算机科学与博弈论
2012-09-18 v1
摘要
马尔可夫决策过程 (MDP) 和简单随机博弈 (SSG) 为研究与概率系统相关的许多重要问题提供了丰富的数学框架。具有有限时域目标的 MDP 和 SSG(其目标是在给定的有限时间内最大化到达目标状态的概率)是一个经典且被广泛研究的问题。在本文中,我们考虑有限时域 MDP 和 SSG 的策略复杂性。我们表明,对于所有 ,自然的基于计数器的策略类最多需要 个记忆状态,并且需要大小为 的记忆。因此,我们的界限是渐近最优的。随后,我们研究了最优策略的周期性性质,并证明了最优策略周期的次指数下界。
引用
@article{arxiv.1209.3617,
title = {Strategy complexity of finite-horizon Markov decision processes and simple stochastic games},
author = {Krishnendu Chatterjee and Rasmus Ibsen-Jensen},
journal= {arXiv preprint arXiv:1209.3617},
year = {2012}
}