中文

随机单边全信息赌博机

机器学习 2019-06-21 v1 数据结构与算法 机器学习

摘要

在本文中,我们研究单边全信息赌博机问题的随机版本,其中我们有 KK 个臂 [K]={1,2,,K}[K] = \{1, 2, \ldots, K\},玩臂 ii 将从臂 ii 的未知分布中获得奖励,同时获得所有臂 jij \ge i 的奖励反馈。单边全信息赌博机可以建模在线重复第二价格拍卖,其中拍卖者可以在每轮选择保留价,而竞标者仅在其出价高于保留价时揭示其出价。在本文中,我们提出一种基于消除的算法来解决该问题。我们的基于消除的算法实现了与分布无关的遗憾上界 O(Tlog(TK))O(\sqrt{T\cdot\log (TK)}),以及与分布有关的界 O((logT+logK)f(Δ))O((\log T + \log K)f(\Delta)),其中 TT 是时间范围,Δ\Delta 是各臂平均奖励与最优臂平均奖励之间差距的向量,f(Δ)f(\Delta) 是一个依赖于差距向量的公式,我们将详细说明。我们的算法具有目前最好的理论遗憾上界。我们还针对其他可能的替代方案对我们的算法进行了实证验证。

关键词

引用

@article{arxiv.1906.08656,
  title  = {Stochastic One-Sided Full-Information Bandit},
  author = {Haoyu Zhao and Wei Chen},
  journal= {arXiv preprint arXiv:1906.08656},
  year   = {2019}
}