中文

一种针对随机 bandit 的极小极大且渐近最优算法

机器学习 2017-09-21 v2 机器学习 统计理论 统计理论

摘要

我们提出 kl-UCB++ 算法,用于在具有指数族分布的随机 bandit 模型中进行后悔最小化。我们证明该算法同时是渐近最优的(在 Lai 和 Robbins 下界的意义上)和极小极大最优的。这是首个被证明同时具备这两种性质的算法。因此,本工作以简洁清晰的证明合并了两条不同的研究路线。

关键词

引用

@article{arxiv.1702.07211,
  title  = {A minimax and asymptotically optimal algorithm for stochastic bandits},
  author = {Pierre Ménard and Aurélien Garivier},
  journal= {arXiv preprint arXiv:1702.07211},
  year   = {2017}
}