随机与非随机多臂老虎机问题的遗憾分析
机器学习
2012-11-06 v2 机器学习
摘要
多臂老虎机问题是具有探索-利用权衡的序贯决策问题的最基本示例。这是在坚持过去带来最高收益的选项与探索未来可能带来更高收益的新选项之间取得平衡。尽管对老虎机问题的研究可以追溯到二十世纪三十年代,但探索-利用权衡也出现在一些现代应用中,例如广告投放、网站优化和数据包路由。在数学上,多臂老虎机由与每个选项相关的收益过程定义。在本综述中,我们关注两种极端情况,其中遗憾分析特别简单和优雅:独立同分布收益和对抗性收益。除了有限动作的基本设置外,我们还分析了一些最重要的变体和扩展,例如上下文老虎机模型。
引用
@article{arxiv.1204.5721,
title = {Regret Analysis of Stochastic and Nonstochastic Multi-armed Bandit Problems},
author = {Sébastien Bubeck and Nicolò Cesa-Bianchi},
journal= {arXiv preprint arXiv:1204.5721},
year = {2012}
}
备注
To appear in Foundations and Trends in Machine Learning