有界随机赌博机及更广场景下的KL-UCB算法
统计理论
2013-08-30 v5 机器学习
系统与控制
最优化与控制
统计理论
摘要
本文对KL-UCB算法进行了有限时间分析,该算法是一种用于随机赌博机问题的在线、无视界指标策略。我们证明了两个不同的结果:首先,对于任意有界奖励,KL-UCB算法满足比UCB或UCB2一致更优的遗憾界;其次,在伯努利奖励的特殊情况下,它达到了Lai和Robbins的下界。此外,我们表明KL-UCB算法的简单变体对于特定类别的(可能无界)奖励也是最优的,包括从指数族分布生成的奖励。一项将KL-UCB与其主要竞争对手(UCB、UCB2、UCB-Tuned、UCB-V、DMED)进行比较的大规模数值研究表明,KL-UCB非常高效且稳定,包括在短时间范围内。KL-UCB也是唯一始终优于基本UCB策略的方法。我们的遗憾界依赖于附录中陈述并证明的具有独立兴趣的偏差结果。作为副产品,我们还获得了标准UCB算法的改进遗憾界。
引用
@article{arxiv.1102.2490,
title = {The KL-UCB Algorithm for Bounded Stochastic Bandits and Beyond},
author = {Aurélien Garivier and Olivier Cappé},
journal= {arXiv preprint arXiv:1102.2490},
year = {2013}
}
备注
18 pages, 3 figures; Conf. Comput. Learning Theory (COLT) 2011 in Budapest, Hungary