中文

先观察后行动:带预观测的多臂老虎机

机器学习 2019-11-22 v1 机器学习

摘要

我们考虑随机多臂老虎机(MAB)问题的一个设定:玩家在每轮中可付费预观测臂的奖励后再选择臂进行拉动。除了在探索新臂以寻找最优臂与利用被认为奖励最高的臂之间的通常权衡外,我们还遇到一个额外的困境:预观测更多臂可更大概率拉动最优臂,但会产生更大代价。在单玩家设定下,我们为具有伯努利奖励的K个臂设计了先观察后行动上置信界(OBP-UCB)算法,并证明了T轮后悔上界为O(K^2\log T)。在多玩家设定中,当玩家在同一轮选择同一臂拉动时会发生碰撞。我们设计了一种集中式算法C-MP-OBP,并证明其相对于离线贪心策略的T轮后悔在K个臂和M个玩家下以上界O(\frac{K^4}{M^2}\log T)受限。我们还提出了C-MP-OBP策略的分布式版本,称为D-MP-OBP和D-MP-Adapt-OBP,实现了相对于无碰撞目标策略的对数后悔。在合成数据和无线信道迹上的实验表明,C-MP-OBP和D-MP-OBP优于不允许预观测的随机启发式算法和离线最优策略。

关键词

引用

@article{arxiv.1911.09458,
  title  = {Observe Before Play: Multi-armed Bandit with Pre-observations},
  author = {Jinhang Zuo and Xiaoxi Zhang and Carlee Joe-Wong},
  journal= {arXiv preprint arXiv:1911.09458},
  year   = {2019}
}