中文

全局非平稳多臂老虎机的有限时间分析

机器学习 2023-10-27 v2 机器学习

摘要

我们考虑模型参数随时间变化的非平稳多臂老虎机问题。我们引入了自适应重置老虎机(ADR-bandit),这是一类利用数据流文献中自适应窗口技术的老虎机算法。我们首先为自适应窗口技术产生的估计量质量提供了新的保证,这具有独立的研究价值。此外,我们在两种典型环境中对ADR-bandit进行了有限时间分析:变化瞬时发生的突变环境和变化逐渐发生的渐变环境。我们证明,当突变或渐变以我们称之为全局变化的协调方式发生时,ADR-bandit具有近乎最优的性能。我们证明,在假设存在这种全局变化的情况下,强制探索是不必要的。与现有的非平稳老虎机算法不同,ADR-bandit在平稳环境以及具有全局变化的非平稳环境中均表现出最优性能。我们的实验表明,所提出的算法在合成环境和真实世界环境中均优于现有方法。

关键词

引用

@article{arxiv.2107.11419,
  title  = {Finite-time Analysis of Globally Nonstationary Multi-Armed Bandits},
  author = {Junpei Komiyama and Edouard Fouché and Junya Honda},
  journal= {arXiv preprint arXiv:2107.11419},
  year   = {2023}
}

备注

Revision: Regret bound for ADR-Bandit + TS