中文

未知 MDP 中 Omega-正则约束下的基于学习的均值收益优化

人工智能 2018-08-24 v4 计算机科学中的逻辑

摘要

我们形式化了在具有未知概率转移函数和未知收益函数的马尔可夫决策过程(MDP)中,以高概率最大化均值收益值同时满足奇偶目标的问题。假设未知转移函数的支撑集和最小转移概率的下界事先已知,我们表明,在由单一末端分量构成的 MDP 中,根据愿意使用的内存量不同,可以实现奇偶目标与均值收益目标的两类保证组合。(i) 对所有 ϵ\epsilonγ\gamma,我们可以构造一种在线学习有限内存策略,该策略几乎必然满足奇偶目标,并以至少 1γ1 - \gamma 的概率实现 ϵ\epsilon-最优均值收益。(ii) 或者,对所有 ϵ\epsilonγ\gamma,存在一种在线学习无限内存策略,该策略必然满足奇偶目标,并以至少 1γ1 - \gamma 的概率实现 ϵ\epsilon-最优均值收益。我们以自然的方式将上述结果推广到由多个末端分量构成的 MDP。最后,我们表明上述保证是紧的,即存在某些 MDP,无法确保其更强的保证组合。

关键词

引用

@article{arxiv.1804.08924,
  title  = {Learning-Based Mean-Payoff Optimization in an Unknown MDP under Omega-Regular Constraints},
  author = {Jan Křetínský and Guillermo A. Pérez and Jean-François Raskin},
  journal= {arXiv preprint arXiv:1804.08924},
  year   = {2018}
}