两全其美:随机与对抗赌博机
机器学习
2012-02-22 v1 数据结构与算法
摘要
我们提出了一种新的赌博机算法 SAO(随机与对抗最优),其遗憾在对抗奖励和随机奖励下本质上都是最优的。具体而言,SAO 结合了 Exp3(Auer 等,SIAM J. on Computing 2002)的平方根最坏情况遗憾和 UCB1(Auer 等,Machine Learning 2002)在随机奖励下的(多)对数遗憾。对抗奖励和随机奖励是(非贝叶斯)多臂赌博机文献中的两种主要设定。先前关于多臂赌博机的工作将它们分开处理,并未尝试同时优化两者。我们的结果属于一个总体主题:在实现良好最坏情况性能的同时,利用“良好”的问题实例,这是设计具有部分已知输入的算法中的一个重要问题。
引用
@article{arxiv.1202.4473,
title = {The best of both worlds: stochastic and adversarial bandits},
author = {Sebastien Bubeck and Aleksandrs Slivkins},
journal= {arXiv preprint arXiv:1202.4473},
year = {2012}
}