中文

面向分段平稳_bandit的高效变点检测

机器学习 2020-12-09 v2 机器学习 统计理论 统计理论

摘要

我们提出GLR-klUCB,一种用于具有有界奖励的分段iid非平稳bandit问题的新算法。该算法将高效的bandit算法kl-UCB与高效的、无参数的变点检测器Bernoulli广义似然比检验相结合,我们为后者提供了新的具有独立意义的理 guarantees。与以往使用变点检测器的非平稳bandit算法不同,GLR-klUCB无需基于关于臂均值的先验知识进行校准。我们证明该算法在某些“简单”实例上于T轮内可达到O(TAΥTlog(T))O(\sqrt{TA \Upsilon_T\log(T)})后悔界,其中A为臂数,ΥT\Upsilon_T为变点数,且无需ΥT\Upsilon_T的先验知识。与近期提出的对ΥT\Upsilon_T无知的算法相比,我们进行的数值研究表明GLR-klUCB在实践中也极为高效,超越简单实例。

关键词

引用

@article{arxiv.1902.01575,
  title  = {Efficient Change-Point Detection for Tackling Piecewise-Stationary Bandits},
  author = {Lilian Besson and Emilie Kaufmann and Odalric-Ambrym Maillard and Julien Seznec},
  journal= {arXiv preprint arXiv:1902.01575},
  year   = {2020}
}