可数MDP中的Büchi目标
概率论
2019-05-01 v2 形式语言与自动机理论
最优化与控制
摘要
我们研究具有Büchi目标的可数无限马尔可夫决策过程,该目标要求无限次访问给定状态子集。T.P. Hill在1979年留下的一个开放问题是:是否总存在 -最优马尔可夫策略,即仅基于当前状态与迄今所走步数做决策的策略。我们通过构造一个非平凡反例对该问题给出否定回答。另一方面,我们证明仅带1比特额外内存的马尔可夫策略已足够。
引用
@article{arxiv.1904.11573,
title = {B\"uchi Objectives in Countable MDPs},
author = {Stefan Kiefer and Richard Mayr and Mahsa Shirmohammadi and Patrick Totzke},
journal= {arXiv preprint arXiv:1904.11573},
year = {2019}
}
备注
full version of an ICALP'19 paper. This update only fixes some typesetting issues