一种针对随机 bandit 的极小极大且渐近最优算法
机器学习
2017-09-21 v2 机器学习
统计理论
统计理论
摘要
我们提出 kl-UCB++ 算法,用于在具有指数族分布的随机 bandit 模型中进行后悔最小化。我们证明该算法同时是渐近最优的(在 Lai 和 Robbins 下界的意义上)和极小极大最优的。这是首个被证明同时具备这两种性质的算法。因此,本工作以简洁清晰的证明合并了两条不同的研究路线。
引用
@article{arxiv.1702.07211,
title = {A minimax and asymptotically optimal algorithm for stochastic bandits},
author = {Pierre Ménard and Aurélien Garivier},
journal= {arXiv preprint arXiv:1702.07211},
year = {2017}
}