中文

面向非平稳多臂_bandit问题的折扣化Thompson采样

机器学习 2023-05-23 v2 机器学习

摘要

非平稳多臂_bandit(NS-MAB)问题近年来受到显著关注。NS-MAB通常建模为两种场景:突变式变化,即奖励分布在一段时间内保持恒定并在未知时间步发生变化;以及平滑式变化,即奖励分布基于未知动态平滑演化。本文提出带有高斯先验的折扣化Thompson采样(DS-TS)以应对这两种非平稳设定。我们的算法通过将折扣因子引入Thompson采样来被动适应变化。DS-TS方法已通过实验验证,但其后悔上界的分析目前尚缺。在温和假设下,我们证明带有高斯先验的DS-TS在突变式变化下可达到O~(TBT)\tilde{O}(\sqrt{TB_T})量级、在平滑式变化下可达到O~(Tβ)\tilde{O}(T^{\beta})量级的近最优后悔界,其中TT为时间步数,BTB_T为断点数,β\beta与平滑变化环境相关,O~\tilde{O}隐藏了与TT无关的参数及对数项。此外,DS-TS与其他非平稳_bandit算法的经验比较展示了其具有竞争力的性能。具体而言,当可获得最大期望奖励的先验知识时,DS-TS有潜力超越最先进(state-of-the-art)算法。

关键词

引用

@article{arxiv.2305.10718,
  title  = {Discounted Thompson Sampling for Non-Stationary Bandit Problems},
  author = {Han Qi and Yue Wang and Li Zhu},
  journal= {arXiv preprint arXiv:2305.10718},
  year   = {2023}
}