中文

汤普森采样:渐近最优的有限时间分析

机器学习 2012-07-20 v2 机器学习

摘要

关于汤普森采样解决随机多臂赌博机问题的最优性问题自1933年以来一直悬而未决。在本文中,我们针对伯努利奖励的情况给出了肯定回答,提供了第一个有限时间分析,匹配了Lai和Robbins累积遗憾下界给出的渐近率。证明附有与其他最优策略的数值比较,这些实验在伯努利情况下直到现在在文献中一直缺失。

关键词

引用

@article{arxiv.1205.4217,
  title  = {Thompson Sampling: An Asymptotically Optimal Finite Time Analysis},
  author = {Emilie Kaufmann and Nathaniel Korda and Rémi Munos},
  journal= {arXiv preprint arXiv:1205.4217},
  year   = {2012}
}

备注

15 pages, 2 figures, submitted to ALT (Algorithmic Learning Theory)