中文

两全其美:随机与对抗赌博机

机器学习 2012-02-22 v1 数据结构与算法

摘要

我们提出了一种新的赌博机算法 SAO(随机与对抗最优),其遗憾在对抗奖励和随机奖励下本质上都是最优的。具体而言,SAO 结合了 Exp3(Auer 等,SIAM J. on Computing 2002)的平方根最坏情况遗憾和 UCB1(Auer 等,Machine Learning 2002)在随机奖励下的(多)对数遗憾。对抗奖励和随机奖励是(非贝叶斯)多臂赌博机文献中的两种主要设定。先前关于多臂赌博机的工作将它们分开处理,并未尝试同时优化两者。我们的结果属于一个总体主题:在实现良好最坏情况性能的同时,利用“良好”的问题实例,这是设计具有部分已知输入的算法中的一个重要问题。

关键词

引用

@article{arxiv.1202.4473,
  title  = {The best of both worlds: stochastic and adversarial bandits},
  author = {Sebastien Bubeck and Aleksandrs Slivkins},
  journal= {arXiv preprint arXiv:1202.4473},
  year   = {2012}
}