中文

用于随机多臂老虎机中最优臂识别的非线性序贯接受与拒绝

机器学习 2017-07-11 v1 机器学习

摘要

我们解决多臂老虎机(multi-armed bandits)中的 M-最优臂识别问题。玩家拥有有限预算来探索 K 个臂(M<K),每个臂被拉动后会产生一个从固定的未知分布中(独立)抽取的奖励。目标是找到期望奖励意义上的前 M 个臂。我们开发了一种按轮次进行以迭代地停用臂的算法。在每一轮,预算由剩余臂数量的非线性函数除分,并相应地拉动臂。基于决策规则,每轮停用的臂可被接受或拒绝。算法输出被接受的臂,理想情况下这些臂应为前 M 个臂。我们刻画了误识别概率的衰减速率,并证实非线性预算分配对于不同的问题环境(由竞争臂的数量描述)是有用的。我们提供了全面的数值实验,表明我们的算法利用合适的非线性超越了 state-of-the-art 方法。

关键词

引用

@article{arxiv.1707.02649,
  title  = {Nonlinear Sequential Accepts and Rejects for Identification of Top Arms in Stochastic Bandits},
  author = {Shahin Shahrampour and Vahid Tarokh},
  journal= {arXiv preprint arXiv:1707.02649},
  year   = {2017}
}

备注

7 pages