中文

具有变化检测的近最优自适应分段平稳赌博机过程

机器学习 2019-01-25 v4 机器学习

摘要

多臂赌博机(MAB)是一类在线学习问题,其中学习智能体在反复选择拉动具有未知奖励分布的臂时,旨在最大化其期望累积奖励。我们考虑一种场景,其中奖励分布可能在未知时间步以分段平稳的方式发生变化。我们表明,通过将一个简单的变化检测组件与经典UCB算法结合以检测和适应变化,我们所谓的M-UCB算法可以在 O(MKTlogT)O(\sqrt{MKT\log T}) 量级上实现近最优后悔界,其中 TT 为时间步数, KK 为臂的数量, MM 为平稳段的数量。与现有最佳下界比较表明,我们的M-UCB在 TT 上除对数因子外是近最优的。我们还使用公开的Yahoo!数据集在数值实验中将M-UCB与最先进算法进行比较,以展示其优越性能。

关键词

引用

@article{arxiv.1802.03692,
  title  = {Nearly Optimal Adaptive Procedure with Change Detection for Piecewise-Stationary Bandit},
  author = {Yang Cao and Zheng Wen and Branislav Kveton and Yao Xie},
  journal= {arXiv preprint arXiv:1802.03692},
  year   = {2019}
}