有限随机博弈中的双重Thompson采样
机器学习
2022-03-01 v2 计算机科学与博弈论
摘要
我们考虑在有限折扣马尔可夫决策过程下探索与利用的权衡问题,其中底层环境的状态转移矩阵未知。我们提出一种双重Thompson采样强化学习算法(DTS)来解决此类问题。该算法在具有个状态、个动作和直径的时间范围内达到的总后悔界。DTS由两部分组成,第一部分为传统部分,我们基于先验分布在转移矩阵上应用后验采样方法。在第二部分中,我们采用基于计数的后验更新方法,以在局部最优动作与长期最优动作间取得平衡,从而找到全局最优博弈值。我们建立了的后悔界,据我们所知这是迄今为止有限折扣马尔可夫决策过程的最佳后悔界。数值结果证明了我们方法的效率与优越性。
引用
@article{arxiv.2202.10008,
title = {Double Thompson Sampling in Finite stochastic Games},
author = {Shuqing Shi and Xiaobin Wang and Zhiyou Yang and Fan Zhang and Hong Qu},
journal= {arXiv preprint arXiv:2202.10008},
year = {2022}
}