重新审视非平稳参数化赌博机中的加权策略
机器学习
2023-06-08 v2 机器学习
摘要
非平稳参数化赌博机近来备受关注。应对非平稳性有三种原则性方法,包括滑动窗口、加权和重启策略。由于许多非平稳环境表现出渐进漂移模式,加权策略在现实应用中被广泛采用。然而,以往的理论研究表明,其分析更为复杂,且相应算法要么计算效率较低,要么在统计上非最优。本文重新审视非平稳参数化赌博机中的加权策略。在线性赌博机(LB)中,我们发现这一不良特性源于不充分的后悔分析,导致了过于复杂的算法设计。我们提出了一种精细化的分析框架,简化了推导,并且重要的是,产生了一个更简单的基于权重的算法,其效率与基于窗口/重启的算法相当,同时保持了与以往研究相同的后悔界。此外,我们的新框架可用于改进其他参数化赌博机的后悔界,包括广义线性赌博机(GLB)和自共轭赌博机(SCB)。例如,我们开发了一个简单的加权GLB算法,其后悔为,改进了先前工作中的界,其中和刻画奖励模型的非线性,度量非平稳性,和分别表示维数和时间范围。
引用
@article{arxiv.2303.02691,
title = {Revisiting Weighted Strategy for Non-stationary Parametric Bandits},
author = {Jing Wang and Peng Zhao and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:2303.02691},
year = {2023}
}
备注
AISTATS 2023