睡眠组合赌博机
机器学习
2021-06-04 v1
摘要
本文中,我们研究睡眠与组合随机赌博机的一种有趣结合。在此考察的混合模型中,于每个离散时刻,从一个固定的基臂集合中生成任意的可用集。算法可从可用集(睡眠赌博机)中选择一个臂的子集,并接收相应奖励以及半赌博机反馈(组合赌博机)。我们将著名的 CUCB 算法适配于睡眠组合赌博机设定,并称其为 \CSUCB。我们证明——在温和的光滑性条件下——\CSUCB 算法取得了 的依赖于实例的对数后悔保证。我们进一步证明:(i) 当奖励范围有界时,\CSUCB 算法的后悔保证为 ;(ii) 在一般设定下,与实例无关的后悔为 。我们的结果相当通用,并在一般环境下成立——例如实际应用中出现的非加性奖励函数、易变臂可用性、需拉取的基臂数量可变等。我们通过实验验证了所证明的理论保证。
引用
@article{arxiv.2106.01624,
title = {Sleeping Combinatorial Bandits},
author = {Kumar Abhishek and Ganesh Ghalme and Sujit Gujar and Yadati Narahari},
journal= {arXiv preprint arXiv:2106.01624},
year = {2021}
}