中文

追踪无限臂老虎机中的最显著变化

机器学习 2025-02-04 v1 机器学习

摘要

我们研究了一个无限臂老虎机问题,其中动作的平均奖励最初是从一个储备分布中采样的。该设置下的大多数先前工作都集中在平稳奖励上(Berry 等人,1997;Wang 等人,2008;Bonald 和 Proutiere,2013;Carpentier 和 Valko,2015),而更具挑战性的对抗性/非平稳变体仅在最近才在衰减/递减奖励的背景下被研究(Kim 等人,2022;2024)。此外,最优遗憾上界仅在使用非平稳性的参数知识时才能达到,并且仅在储备分布的特定正则性条件下已知。本工作首次展示了适用于所有正则性条件的无参数最优遗憾界,同时放宽了对储备分布的分布假设。我们首先引入一个黑盒方案,将专为近平稳环境设计的有限臂 MAB 算法转换为适用于无限臂非平稳问题的无参数算法,并具有最优遗憾保证。接下来,我们受有限臂 MAB 近期发展的启发(Suk & Kpotufe, 2022),研究了该问题的一个自然“显著转变”概念。我们证明,通过在我们的黑盒方案中采用随机化的消除变体,可以自适应地获得关于显著转变的更紧遗憾界。我们增强的速率仅依赖于衰减的非平稳性,从而展示了该问题的一个有趣现象:上升的奖励并不计入非平稳性的难度。

引用

@article{arxiv.2502.00108,
  title  = {Tracking Most Significant Shifts in Infinite-Armed Bandits},
  author = {Joe Suk and Jung-hun Kim},
  journal= {arXiv preprint arXiv:2502.00108},
  year   = {2025}
}