中文

随机多臂老虎机中的扰动历史探索

机器学习 2019-11-06 v2 机器学习

摘要

我们提出了一种用于随机多臂老虎机中累积后悔最小化的在线算法。该算法在第 tt 轮向其历史中添加 O(t)O(t) 个独立同分布的伪奖励,然后拉动其扰动历史中平均奖励最高的臂。因此,我们称之为扰动历史探索(PHE)。伪奖励经过精心设计,以高概率补偿可能被低估的臂的平均奖励。我们推导了 PHE 的 nn 轮后悔的近最优间隙依赖与无间隙界。我们分析中的关键步骤是一个新的论证,表明随机伯努利奖励会导致乐观性。最后,我们对 PHE 进行了实证评估,表明其与最先进的基线方法具有竞争力。

关键词

引用

@article{arxiv.1902.10089,
  title  = {Perturbed-History Exploration in Stochastic Multi-Armed Bandits},
  author = {Branislav Kveton and Csaba Szepesvari and Mohammad Ghavamzadeh and Craig Boutilier},
  journal= {arXiv preprint arXiv:1902.10089},
  year   = {2019}
}