马尔可夫决策过程的同步目标
计算机科学中的逻辑
2011-02-22 v1 计算复杂性
摘要
我们引入了马尔可夫决策过程(MDP)的同步目标。直观上,同步目标要求最终在每一步都存在一个状态,该状态集中了几乎所有的概率质量。特别地,这意味着概率系统在长期运行中的行为类似于确定性系统:最终,MDP的当前状态可以几乎确定地被识别。我们研究了在MDP中判定是否存在策略以实现同步目标的问题。我们证明了该问题对于一般策略以及盲策略(即参与者无法观察到MDP当前状态的策略)都是可判定的。我们还证明了纯策略是充分的,但可能需要记忆。
引用
@article{arxiv.1102.4121,
title = {Synchronizing Objectives for Markov Decision Processes},
author = {Laurent Doyen and Thierry Massart and Mahsa Shirmohammadi},
journal= {arXiv preprint arXiv:1102.4121},
year = {2011}
}
备注
In Proceedings iWIGP 2011, arXiv:1102.3741