马尔可夫决策过程中后验分布的收敛速率
统计理论
2019-07-23 v1 机器学习
最优化与控制
统计理论
摘要
本文中,我们给出了马尔可夫决策过程(MDP)中模型动力学后验分布在情景式与连续性任务下的收敛速率。理论结果对一般状态与动作空间均成立,且动力学的参数空间可为无限维。此外,我们给出了在固定或最优策略下平均累积奖励的后验分布以及后悔界(regret bound)的收敛速率。提出了一种 Thompson 采样算法的变体,其同时给出动力学的后验收敛速率与后悔型界。随后将前述结果推广至马尔可夫博弈。最后,我们给出了三种仿真场景下的数值结果,并以讨论作结。
引用
@article{arxiv.1907.09083,
title = {Convergence Rates of Posterior Distributions in Markov Decision Process},
author = {Zhen Li and Eric Laber},
journal= {arXiv preprint arXiv:1907.09083},
year = {2019}
}