随机单边全信息赌博机
机器学习
2019-06-21 v1 数据结构与算法
机器学习
摘要
在本文中,我们研究单边全信息赌博机问题的随机版本,其中我们有 个臂 ,玩臂 将从臂 的未知分布中获得奖励,同时获得所有臂 的奖励反馈。单边全信息赌博机可以建模在线重复第二价格拍卖,其中拍卖者可以在每轮选择保留价,而竞标者仅在其出价高于保留价时揭示其出价。在本文中,我们提出一种基于消除的算法来解决该问题。我们的基于消除的算法实现了与分布无关的遗憾上界 ,以及与分布有关的界 ,其中 是时间范围, 是各臂平均奖励与最优臂平均奖励之间差距的向量, 是一个依赖于差距向量的公式,我们将详细说明。我们的算法具有目前最好的理论遗憾上界。我们还针对其他可能的替代方案对我们的算法进行了实证验证。
引用
@article{arxiv.1906.08656,
title = {Stochastic One-Sided Full-Information Bandit},
author = {Haoyu Zhao and Wei Chen},
journal= {arXiv preprint arXiv:1906.08656},
year = {2019}
}