中文

可数MDP中的Büchi目标

概率论 2019-05-01 v2 形式语言与自动机理论 最优化与控制

摘要

我们研究具有Büchi目标的可数无限马尔可夫决策过程,该目标要求无限次访问给定状态子集。T.P. Hill在1979年留下的一个开放问题是:是否总存在 ε\varepsilon-最优马尔可夫策略,即仅基于当前状态与迄今所走步数做决策的策略。我们通过构造一个非平凡反例对该问题给出否定回答。另一方面,我们证明仅带1比特额外内存的马尔可夫策略已足够。

关键词

引用

@article{arxiv.1904.11573,
  title  = {B\"uchi Objectives in Countable MDPs},
  author = {Stefan Kiefer and Richard Mayr and Mahsa Shirmohammadi and Patrick Totzke},
  journal= {arXiv preprint arXiv:1904.11573},
  year   = {2019}
}

备注

full version of an ICALP'19 paper. This update only fixes some typesetting issues