中文

有限随机博弈中的双重Thompson采样

机器学习 2022-03-01 v2 计算机科学与博弈论

摘要

我们考虑在有限折扣马尔可夫决策过程下探索与利用的权衡问题,其中底层环境的状态转移矩阵未知。我们提出一种双重Thompson采样强化学习算法(DTS)来解决此类问题。该算法在具有SS个状态、AA个动作和直径DD的时间范围TT内达到O~(DSAT)\tilde{\mathcal{O}}(D\sqrt{SAT})的总后悔界。DTS由两部分组成,第一部分为传统部分,我们基于先验分布在转移矩阵上应用后验采样方法。在第二部分中,我们采用基于计数的后验更新方法,以在局部最优动作与长期最优动作间取得平衡,从而找到全局最优博弈值。我们建立了O~(T/S2)\tilde{\mathcal{O}}(\sqrt{T}/S^{2})的后悔界,据我们所知这是迄今为止有限折扣马尔可夫决策过程的最佳后悔界。数值结果证明了我们方法的效率与优越性。

关键词

引用

@article{arxiv.2202.10008,
  title  = {Double Thompson Sampling in Finite stochastic Games},
  author = {Shuqing Shi and Xiaobin Wang and Zhiyou Yang and Fan Zhang and Hong Qu},
  journal= {arXiv preprint arXiv:2202.10008},
  year   = {2022}
}