多臂老虎机中贪心算法在多变臂情形下的惊人有效性
机器学习
2024-03-21 v4 机器学习
摘要
我们研究了一种贝叶斯 臂老虎机问题,处于\emph{多变臂}机制中,其中 , 表示时间范围。最初,与近期关于多变臂老虎机问题的文献一致,我们观察到子采样在设计最优算法中起着关键作用;传统的 UCB 算法是次优的,而子采样 UCB(SS-UCB)在 UCB 框架下选择 个臂执行,实现了速率最优。然而,尽管 SS-UCB 在理论上具有最优遗憾的承诺,但它在经验上表现不如一种始终选择经验最佳臂的贪心算法。这一观察通过真实世界数据的模拟扩展到上下文设置。我们的发现表明,在多变臂背景下,存在一种有益于贪心算法的新型\emph{自由探索},其从根本上与关于臂奖励先验分布的尾部事件相关。该发现不同于近期上下文老虎机文献中讨论的与协变量变化相关的自由探索概念。基于这些见解,我们确立了子采样贪心方法不仅在多变臂机制中对伯努利老虎机实现速率最优,而且能在更广泛分布上获得次线性遗憾。总体而言,我们的研究表明,在多变臂机制中,实践者可能会发现采用贪心算法具有更大价值。
引用
@article{arxiv.2002.10121,
title = {The Unreasonable Effectiveness of Greedy Algorithms in Multi-Armed Bandit with Many Arms},
author = {Mohsen Bayati and Nima Hamidi and Ramesh Johari and Khashayar Khosravi},
journal= {arXiv preprint arXiv:2002.10121},
year = {2024}
}