中文

面向非平稳随机多臂老虎机问题的随机打乱与重置方法

人工智能 2016-09-09 v1

摘要

我们考虑随机多臂老虎机的一种非平稳表述,其中奖励不再假设为同分布。对于最佳臂识别任务,我们引入了一种基于 KK 个臂随机打乱的连续消除算法版本。我们证明,在关于均值差 Δ\Delta 的一种新颖且温和的假设下,这种简单但强大的修改在样本复杂度和累积遗憾方面实现了与其原始版本相同的保证,但适用于更广泛的问题类别,因为它不再受限于平稳分布。我们还表明,原始的 {\sc Successive Elimination} 在这种更一般的场景中无法实现受控的遗憾,从而证明了打乱策略的益处。随后,我们放宽了该温和假设,并将算法适配于具有切换臂的最佳臂识别任务。我们适配了该情况下的样本复杂度定义,并证明,面对具有 N1N-1 次最佳臂切换的最优策略,该新算法实现了 O(Δ2NKδ1log(Kδ1))O(\Delta^{-2}\sqrt{NK\delta^{-1} \log(K \delta^{-1})}) 的期望样本复杂度(其中 δ\delta 为算法失败概率),并在 TT 个时间步后实现了 O(Δ1NTKlog(TK))O(\Delta^{-1}{\sqrt{NTK \log (TK)}}) 的期望累积遗憾。

关键词

引用

@article{arxiv.1609.02139,
  title  = {Random Shuffling and Resets for the Non-stationary Stochastic Bandit Problem},
  author = {Robin Allesiardo and Raphaël Féraud and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:1609.02139},
  year   = {2016}
}