汤普森采样:渐近最优的有限时间分析
机器学习
2012-07-20 v2 机器学习
摘要
关于汤普森采样解决随机多臂赌博机问题的最优性问题自1933年以来一直悬而未决。在本文中,我们针对伯努利奖励的情况给出了肯定回答,提供了第一个有限时间分析,匹配了Lai和Robbins累积遗憾下界给出的渐近率。证明附有与其他最优策略的数值比较,这些实验在伯努利情况下直到现在在文献中一直缺失。
引用
@article{arxiv.1205.4217,
title = {Thompson Sampling: An Asymptotically Optimal Finite Time Analysis},
author = {Emilie Kaufmann and Nathaniel Korda and Rémi Munos},
journal= {arXiv preprint arXiv:1205.4217},
year = {2012}
}
备注
15 pages, 2 figures, submitted to ALT (Algorithmic Learning Theory)