自适应光滑非平稳多臂赌博机
机器学习
2025-02-27 v2 机器学习
统计理论
统计理论
摘要
我们研究了一个K臂非平稳多臂赌博机模型,其中奖励随时间平滑变化,具体表示为对时间函数的Hölder类假设。此类平滑变化由Hölder指数β和系数λ参数化。虽然这个通用模型的各种子案例已在孤立情况下研究,但我们首先建立了所有K、β、λ下的最优动态失效率的minimax界限。接下来,我们表明可以在自适应方式下达到最优的动态失效率,而无需事先知道β和λ。与此相比,即使在参数已知的情况下,仅已知β≤1和β=2的有限范围内才有上界(Slivkins, 2014; Krishnamurthy和Gopalan, 2021; Manegueu等, 2021; Jia等, 2023)。因此,我们的工作解决了这些离散文献线程所提出的开放问题。我们还研究了在非平稳bandits中实现更快的gap-dependent失效率的问题。虽然这些速率在一般情况下长期已知不可能实现(Garivier和Moulines, 2011),但我们表明接受安全臂(safe arm)的环境允许比最坏情况下的√T尺度更快的速率。虽然先前的工作聚焦于实现通常的对数失效率上限(summed over stationary periods),但我们的新的gap-dependent速率揭示了非平稳性的新乐观场景,即使对数界限也显得保守。我们表明我们的新的gap-dependent速率是紧的,并且其可达性(即由安全臂所可能实现)在平滑Hölder类模型中有一个惊人简单且干净的表征。
引用
@article{arxiv.2407.08654,
title = {Adaptive Smooth Non-Stationary Bandits},
author = {Joe Suk},
journal= {arXiv preprint arXiv:2407.08654},
year = {2025}
}