中文

可数MDP中的奇偶目标

计算机科学中的逻辑 2017-04-19 v2

摘要

我们研究带有奇偶目标的可数无限MDP(马尔可夫决策过程,MDP),以及Mostowski层次结构中颜色数有界的特殊情况(包括可达性、安全性、Buchi和co-Buchi)。在有限MDP中,奇偶目标总是存在最优无记忆确定性(MD)策略,但这对于可数无限MDP通常不成立。特别地,最优策略可能不存在。对于可数无限MDP,我们给出了Mostowski层次结构中所有目标的最优(相应,ϵ\epsilon-最优)策略的记忆需求的完整刻画。特别地,两类不同目标之间存在强烈的二分性。对于第一类,最优策略(如果存在)可选择为MD,而第二类最优策略需要无限记忆。(即,对于Mostowski层次结构中的所有目标,如果有限记忆随机化策略足够,则MD策略也足够。)类似地,某些目标允许ϵ\epsilon-最优MD策略,而其他目标的ϵ\epsilon-最优策略需要无限记忆。这种二分性也适用于可数无限MDP中有限分支的子类,尽管此处更多目标允许MD策略。

关键词

引用

@article{arxiv.1704.04490,
  title  = {Parity Objectives in Countable MDPs},
  author = {Stefan Kiefer and Richard Mayr and Mahsa Shirmohammadi and Dominik Wojtczak},
  journal= {arXiv preprint arXiv:1704.04490},
  year   = {2017}
}