中文

平滑非平稳赌博机

机器学习 2024-11-19 v3 人工智能 最优化与控制 统计理论 统计理论

摘要

在在线决策的许多应用中,环境是非平稳的,因此使用能处理变化的赌博机算法至关重要。大多数现有方法旨在防范非平滑变化,仅受总变差或随时间 Lipschitz 性的约束。然而在实践中,环境常常发生平滑变化,因此此类算法可能产生不必要的高后悔值。我们研究一个非平稳赌博机问题,其中每个臂的平均奖励序列可嵌入到一个 β\beta-Hölder 函数中,即一个 (β1)(\beta-1) 次 Lipschitz 连续可微的函数。随着 β\beta 增大,非平稳性变得更加平滑。当 β=1\beta=1 时,这对应于非平滑情形,其中 \cite{besbes2014stochastic} 确立了 Θ~(T2/3)\tilde \Theta(T^{2/3}) 的极小极大后悔值。我们通过提出一种在任意 kk 臂、22-Hölder 实例上具有 O~(k4/5T3/5)\tilde O(k^{4/5} T^{3/5}) 后悔值的策略,展示了平滑(即 β2\beta\ge 2)与非平滑(即 β=1\beta=1)情形之间的首次分离。我们补充该结果,证明了在 β\beta-Hölder 实例族上的极小极大后悔值为 Ω(T(β+1)/(2β+1))\Omega(T^{(\beta+1)/(2\beta+1)})(对任意整数 β1\beta\ge 1)。这在对数因子范围内与我们在 β=2\beta=2 时的上界相符。此外,我们使用真实世界点击率数据通过全面的数值研究验证了策略的有效性。

关键词

引用

@article{arxiv.2301.12366,
  title  = {Smooth Non-Stationary Bandits},
  author = {Su Jia and Qian Xie and Nathan Kallus and Peter I. Frazier},
  journal= {arXiv preprint arXiv:2301.12366},
  year   = {2024}
}

备注

Accepted by ICML 2023