中文

关于 Bandit 中 Bootstrap 的新见解

机器学习 2018-05-25 v1 机器学习

摘要

我们研究了 bootstrap 在 bandit 设定中的应用。我们首先证明,常用的非参数 bootstrap (NPB) 过程在可证明的意义上是低效的,并在具有 Bernoulli 奖励的 bandit 模型下建立了其产生的遗憾的近线性下界。我们表明,带有适当强制探索的 NPB 可以产生次线性尽管是次优的遗憾。作为 NPB 的替代方案,我们提出了一种加权 bootstrap (WB) 过程。对于 Bernoulli 奖励,带有乘性指数权重的 WB 在数学上等价于 Thompson 采样 (TS),并产生近最优的遗憾界。类似地,在具有 Gaussian 奖励的 bandit 设定中,我们表明带有加性 Gaussian 权重的 WB 实现了近最优的遗憾。除了这些特殊情况外,我们表明对于几种在 [0,1][0,1] 上有界的奖励分布,WB 比 TS 具有更好的经验性能。对于上下文 bandit 设定,我们给出了实用指南,使得 bootstrap 简单且易于实现,并在真实世界数据集上取得了良好的经验性能。

关键词

引用

@article{arxiv.1805.09793,
  title  = {New Insights into Bootstrapping for Bandits},
  author = {Sharan Vaswani and Branislav Kveton and Zheng Wen and Anup Rao and Mark Schmidt and Yasin Abbasi-Yadkori},
  journal= {arXiv preprint arXiv:1805.09793},
  year   = {2018}
}