中文

关于非平稳多臂老虎机问题的上置信率策略

统计理论 2008-12-18 v1 统计理论

摘要

多臂老虎机问题被视为探索环境以寻找盈利动作与利用既有知识之间的权衡的范式。在平稳情况下,Upper-Confidence Bound (UCB) 策略被证明具有最优收敛率。多臂老虎机问题的一个具有挑战性的变体是非平稳老虎机问题,其中赌徒必须在可能的变化环境中决定每期玩哪一臂。在本文中,我们考虑奖励分布在未知时刻处保持恒定的情形。我们分析了两种算法:discounted UCB 和滑动窗口 UCB。我们为这两种算法建立了期望后悔的上界,通过上界化次优臂被玩上的次数的期望来实现。为此,我们推导了关于自归一化偏差的 Hoeffding 类型不等式,其中有随机的 summand 数量。我们给出在臂奖励分布突然变化时后悔的下界。我们表明,discounted UCB 和滑动窗口 UCB 两种算法均在对数因子范围内与下界匹配。

关键词

引用

@article{arxiv.0805.3415,
  title  = {On Upper-Confidence Bound Policies for Non-Stationary Bandit Problems},
  author = {Aurélien Garivier and Eric Moulines},
  journal= {arXiv preprint arXiv:0805.3415},
  year   = {2008}
}

备注

24 pages