中文

一种针对随机和对抗式多臂赌博机均具有近最优伪遗憾的算法

机器学习 2016-05-30 v1

摘要

我们提出一种算法,针对对抗式和随机式多臂赌博机均实现了几乎最优的伪遗憾界。针对对抗式多臂赌博机,伪遗憾为 O(Knlogn)O(K\sqrt{n \log n});针对随机式多臂赌博机,伪遗憾为 O(i(logn)/Δi)O(\sum_i (\log n)/\Delta_i)。我们还证明,任何针对随机式多臂赌博机具有 O(logn)O(\log n) 伪遗憾的算法,不可能针对自适应对抗式多臂赌博机实现 O~(n)\tilde{O}(\sqrt{n}) 期望遗憾。这补充了 Bubeck 和 Slivkins (2012) 的先前结果,他们展示了具有 O((logn)2)O((\log n)^2) 随机伪遗憾的 O~(n)\tilde{O}(\sqrt{n}) 期望对抗遗憾。

关键词

引用

@article{arxiv.1605.08722,
  title  = {An algorithm with nearly optimal pseudo-regret for both stochastic and adversarial bandits},
  author = {Peter Auer and Chao-Kai Chiang},
  journal= {arXiv preprint arXiv:1605.08722},
  year   = {2016}
}