中文

腐烂赌博机并不比随机赌博机更难

机器学习 2020-05-12 v2 机器学习

摘要

在随机多臂赌博机中,假设每臂的奖励分布是平稳的。该假设在实践中常被违背(例如推荐系统中),其中某臂的奖励可能在被选择时发生变化,即休息赌博机设定。本文考虑非参数腐烂赌博机设定,其中奖励只能递减。我们引入扩展窗口平均滤波(FEWA)算法,该算法构建递增窗口的移动平均以识别在再次拉动时更可能返回高奖励的臂。我们证明,对于未知时域 TT,且在无需任何关于 KK 臂递减行为的知识下,FEWA 取得了问题依赖后悔界 O~(log(KT))\widetilde{\mathcal{O}}(\log{(KT)}) 与问题无关后悔界 O~(KT)\widetilde{\mathcal{O}}(\sqrt{KT})。我们的结果大幅改进了 Levine 等人(2017)的算法,其后悔为 O~(K1/3T2/3)\widetilde{\mathcal{O}}(K^{1/3}T^{2/3})。FEWA 也匹配已知的随机赌博机设定界限,从而表明腐烂赌博机并不更难。最后,我们报告了证实 FEWA 理论改进的仿真。

关键词

引用

@article{arxiv.1811.11043,
  title  = {Rotting bandits are not harder than stochastic ones},
  author = {Julien Seznec and Andrea Locatelli and Alexandra Carpentier and Alessandro Lazaric and Michal Valko},
  journal= {arXiv preprint arXiv:1811.11043},
  year   = {2020}
}