中文

概率空间上的距离及其在马尔可夫决策过程与重复博弈中的长期值

最优化与控制 2012-02-29 v1

摘要

给定一个有限集KK,记X=Δ(K)X=\Delta(K)KK上的概率集,Z=Δf(X)Z=\Delta_f(X)X上具有有限支撑的Borel概率集。研究X上具有有限支撑的Borel概率集。研究K上具有部分信息的马尔可夫决策过程自然会导致上具有部分信息的马尔可夫决策过程自然会导致X上具有完全信息的马尔可夫决策过程。我们在上具有完全信息的马尔可夫决策过程。我们在Z上引入了一个新度量上引入了一个新度量d_*,使得转移从,使得转移从(X, \|.\|_1)(Z,d_*)1Lipschitz的。在文章的第一部分,我们定义并证明了度量是1-Lipschitz的。在文章的第一部分,我们定义并证明了度量d_*的若干性质。特别地,的若干性质。特别地,d_*满足KantorovichRubinstein型对偶公式,并可通过分解来刻画。在第二部分,我们刻画了几类“紧致非扩张”马尔可夫决策过程中的极限值。特别地,我们使用度量满足Kantorovich-Rubinstein型对偶公式,并可通过分解来刻画。在第二部分,我们刻画了几类“紧致非扩张”马尔可夫决策过程中的极限值。特别地,我们使用度量d_*来刻画具有有限状态的部分可观测MDP以及具有有限状态和动作集的知情控制器重复博弈中的极限值。此外,在每种情况下,我们都能证明一种广义一致值的存在性,其中我们不仅考虑阶段数足够大时的Cesaˋro均值,而且考虑当不耐烦度来刻画具有有限状态的部分可观测MDP以及具有有限状态和动作集的知情控制器重复博弈中的极限值。此外,在每种情况下,我们都能证明一种广义一致值的存在性,其中我们不仅考虑阶段数足够大时的Cesàro均值,而且考虑当不耐烦度I(\theta)=\sum_{t\geq 1} |\theta_{t+1}-\theta_t|足够小时任何评估函数足够小时任何评估函数\theta \in \Delta(\N^*)$。

关键词

引用

@article{arxiv.1202.6259,
  title  = {A distance for probability spaces, and long-term values in Markov Decision Processes and Repeated Games},
  author = {Jérôme Renault and Xavier Venel},
  journal= {arXiv preprint arXiv:1202.6259},
  year   = {2012}
}