中文

连续时间马尔可夫决策过程与马尔可夫博弈的最优时间抽象调度器

形式语言与自动机理论 2010-06-29 v1

摘要

我们研究了连续时间马尔可夫决策过程中针对时间抽象调度器类别的有界时间可达性问题。此类可达性问题在可靠性分析以及制造系统和排队系统的建模中扮演着至关重要的角色。因此,对其分析已得到深入研究,且最优控制的近似技术也已得到充分理解。然而,从数学角度来看,近似问题相较于最优控制是否存在这一基本问题而言是次要的。我们证明了对于所有连续时间马尔可夫决策过程,时间抽象调度器类别中存在最优调度器。我们的证明是构造性的:我们展示了如何计算具有有限记忆的最优时间抽象策略。结果表明,这些最优调度器具有极其简单的结构——它们在有限步数后收敛到一个易于计算的无记忆调度策略。最后,我们展示了我们的论证可以轻松推广到马尔可夫博弈:我们证明了在这类更一般的结构中,两个玩家都拥有同样简单的最优策略。

关键词

引用

@article{arxiv.1006.5103,
  title  = {Optimal Time-Abstract Schedulers for CTMDPs and Markov Games},
  author = {Markus Rabe and Sven Schewe},
  journal= {arXiv preprint arXiv:1006.5103},
  year   = {2010}
}