随机多臂老虎机中的扰动历史探索
机器学习
2019-11-06 v2 机器学习
摘要
我们提出了一种用于随机多臂老虎机中累积后悔最小化的在线算法。该算法在第 轮向其历史中添加 个独立同分布的伪奖励,然后拉动其扰动历史中平均奖励最高的臂。因此,我们称之为扰动历史探索(PHE)。伪奖励经过精心设计,以高概率补偿可能被低估的臂的平均奖励。我们推导了 PHE 的 轮后悔的近最优间隙依赖与无间隙界。我们分析中的关键步骤是一个新的论证,表明随机伯努利奖励会导致乐观性。最后,我们对 PHE 进行了实证评估,表明其与最先进的基线方法具有竞争力。
引用
@article{arxiv.1902.10089,
title = {Perturbed-History Exploration in Stochastic Multi-Armed Bandits},
author = {Branislav Kveton and Csaba Szepesvari and Mohammad Ghavamzadeh and Craig Boutilier},
journal= {arXiv preprint arXiv:1902.10089},
year = {2019}
}