面向非平稳多臂_bandit问题的折扣化Thompson采样
机器学习
2023-05-23 v2 机器学习
摘要
非平稳多臂_bandit(NS-MAB)问题近年来受到显著关注。NS-MAB通常建模为两种场景:突变式变化,即奖励分布在一段时间内保持恒定并在未知时间步发生变化;以及平滑式变化,即奖励分布基于未知动态平滑演化。本文提出带有高斯先验的折扣化Thompson采样(DS-TS)以应对这两种非平稳设定。我们的算法通过将折扣因子引入Thompson采样来被动适应变化。DS-TS方法已通过实验验证,但其后悔上界的分析目前尚缺。在温和假设下,我们证明带有高斯先验的DS-TS在突变式变化下可达到量级、在平滑式变化下可达到量级的近最优后悔界,其中为时间步数,为断点数,与平滑变化环境相关,隐藏了与无关的参数及对数项。此外,DS-TS与其他非平稳_bandit算法的经验比较展示了其具有竞争力的性能。具体而言,当可获得最大期望奖励的先验知识时,DS-TS有潜力超越最先进(state-of-the-art)算法。
引用
@article{arxiv.2305.10718,
title = {Discounted Thompson Sampling for Non-Stationary Bandit Problems},
author = {Han Qi and Yue Wang and Li Zhu},
journal= {arXiv preprint arXiv:2305.10718},
year = {2023}
}