概率空间上的距离及其在马尔可夫决策过程与重复博弈中的长期值
最优化与控制
2012-02-29 v1
摘要
给定一个有限集K,记X=Δ(K)为K上的概率集,Z=Δf(X)为X上具有有限支撑的Borel概率集。研究K上具有部分信息的马尔可夫决策过程自然会导致X上具有完全信息的马尔可夫决策过程。我们在Z上引入了一个新度量d_*,使得转移从(X, \|.\|_1)到(Z,d_*)是1−Lipschitz的。在文章的第一部分,我们定义并证明了度量d_*的若干性质。特别地,d_*满足Kantorovich−Rubinstein型对偶公式,并可通过分解来刻画。在第二部分,我们刻画了几类“紧致非扩张”马尔可夫决策过程中的极限值。特别地,我们使用度量d_*来刻画具有有限状态的部分可观测MDP以及具有有限状态和动作集的知情控制器重复博弈中的极限值。此外,在每种情况下,我们都能证明一种广义一致值的存在性,其中我们不仅考虑阶段数足够大时的Cesaˋro均值,而且考虑当不耐烦度I(\theta)=\sum_{t\geq 1} |\theta_{t+1}-\theta_t|足够小时任何评估函数\theta \in \Delta(\N^*)$。
引用
@article{arxiv.1202.6259,
title = {A distance for probability spaces, and long-term values in Markov Decision Processes and Repeated Games},
author = {Jérôme Renault and Xavier Venel},
journal= {arXiv preprint arXiv:1202.6259},
year = {2012}
}