中文

KL-UCB-switch:从依赖分布与独立于分布双视角看随机多臂老虎机的最优后悔界

机器学习 2022-07-04 v3 机器学习 统计理论 统计理论

摘要

我们考虑 KK 臂随机老虎机,并考察截至时间 TT 的累积后悔界。我们感兴趣的是同时实现最优阶 KT\sqrt{KT} 的独立于分布的后悔界,以及渐近最优的依赖于分布的后悔界,即与 Lai 和 Robbins (1985) 及 Burnetas 和 Katehakis (1996) 的 κlnT\kappa\ln T 下界相匹配,其中 κ\kappa 为最优问题相关常数。该常数 κ\kappa 依赖于所考虑的模型 D\mathcal{D}(臂上可能分布的族)。M\'enard 和 Garivier (2017) 在一维指数族给出的参数模型情形下提供了实现此种双最优性的策略,而 Lattimore (2016, 2018) 对方差小于 11 的(次)高斯分布族做到了这一点。我们将此结果推广到 [0,1][0,1] 上所有分布的非参数情形。为此,我们结合了 Audibert 和 Bubeck (2009) 的 MOSS 策略(其享有最优阶 KT\sqrt{KT} 的独立于分布的后悔界)与 Capp\'e 等人 (2013) 的 KL-UCB 策略,在此过程中我们给出了其在 [0,1][0,1] 上所有分布模型中最优依赖于分布的 κlnT\kappa\ln T 后悔界的首次分析。我们能在努力精简证明(针对已知后悔界及因此对新分析)的同时获得此非参数双最优性结果;因而本工作的另一贡献是提供了关于 KK 臂随机老虎机基于索引策略的经典后悔界证明的综述。

关键词

引用

@article{arxiv.1805.05071,
  title  = {KL-UCB-switch: optimal regret bounds for stochastic bandits from both a distribution-dependent and a distribution-free viewpoints},
  author = {Aurélien Garivier and Hédi Hadiji and Pierre Menard and Gilles Stoltz},
  journal= {arXiv preprint arXiv:1805.05071},
  year   = {2022}
}