中文

重新审视非平稳参数化赌博机中的加权策略

机器学习 2023-06-08 v2 机器学习

摘要

非平稳参数化赌博机近来备受关注。应对非平稳性有三种原则性方法,包括滑动窗口、加权和重启策略。由于许多非平稳环境表现出渐进漂移模式,加权策略在现实应用中被广泛采用。然而,以往的理论研究表明,其分析更为复杂,且相应算法要么计算效率较低,要么在统计上非最优。本文重新审视非平稳参数化赌博机中的加权策略。在线性赌博机(LB)中,我们发现这一不良特性源于不充分的后悔分析,导致了过于复杂的算法设计。我们提出了一种精细化的分析框架,简化了推导,并且重要的是,产生了一个更简单的基于权重的算法,其效率与基于窗口/重启的算法相当,同时保持了与以往研究相同的后悔界。此外,我们的新框架可用于改进其他参数化赌博机的后悔界,包括广义线性赌博机(GLB)和自共轭赌博机(SCB)。例如,我们开发了一个简单的加权GLB算法,其后悔为O~(kμ54cμ34d34PT14T34)\widetilde{O}(k_\mu^{\frac{5}{4}} c_\mu^{-\frac{3}{4}} d^{\frac{3}{4}} P_T^{\frac{1}{4}}T^{\frac{3}{4}}),改进了先前工作中的O~(kμ2cμ1d910PT15T45)\widetilde{O}(k_\mu^{2} c_\mu^{-1}d^{\frac{9}{10}} P_T^{\frac{1}{5}}T^{\frac{4}{5}})界,其中kμk_\mucμc_\mu刻画奖励模型的非线性,PTP_T度量非平稳性,ddTT分别表示维数和时间范围。

关键词

引用

@article{arxiv.2303.02691,
  title  = {Revisiting Weighted Strategy for Non-stationary Parametric Bandits},
  author = {Jing Wang and Peng Zhao and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2303.02691},
  year   = {2023}
}

备注

AISTATS 2023