中文

常数空间的随机多臂老虎机

数据结构与算法 2018-05-17 v2 机器学习 机器学习

摘要

我们考虑次线性空间设定下的随机老虎机问题,其中无法记录所有 KK 个臂的胜负记录。我们给出一种使用 O(1)O(1) 字空间的算法,其悔值界为 i=1K1ΔilogΔiΔlogT \sum_{i=1}^{K}\frac{1}{\Delta_i}\log \frac{\Delta_i}{\Delta}\log T 其中 Δi\Delta_i 为最优臂与第 ii 个臂之间的差距,Δ\Delta 为最优臂与第二优臂之间的差距。若收益远离 0011 有界,则该悔值在无空间约束下可能最优悔值的 O(log1/Δ)O(\log 1/\Delta) 因子范围内。

关键词

引用

@article{arxiv.1712.09007,
  title  = {Stochastic Multi-armed Bandits in Constant Space},
  author = {David Liau and Eric Price and Zhao Song and Ger Yang},
  journal= {arXiv preprint arXiv:1712.09007},
  year   = {2018}
}

备注

AISTATS 2018