全局非平稳多臂老虎机的有限时间分析
机器学习
2023-10-27 v2 机器学习
摘要
我们考虑模型参数随时间变化的非平稳多臂老虎机问题。我们引入了自适应重置老虎机(ADR-bandit),这是一类利用数据流文献中自适应窗口技术的老虎机算法。我们首先为自适应窗口技术产生的估计量质量提供了新的保证,这具有独立的研究价值。此外,我们在两种典型环境中对ADR-bandit进行了有限时间分析:变化瞬时发生的突变环境和变化逐渐发生的渐变环境。我们证明,当突变或渐变以我们称之为全局变化的协调方式发生时,ADR-bandit具有近乎最优的性能。我们证明,在假设存在这种全局变化的情况下,强制探索是不必要的。与现有的非平稳老虎机算法不同,ADR-bandit在平稳环境以及具有全局变化的非平稳环境中均表现出最优性能。我们的实验表明,所提出的算法在合成环境和真实世界环境中均优于现有方法。
引用
@article{arxiv.2107.11419,
title = {Finite-time Analysis of Globally Nonstationary Multi-Armed Bandits},
author = {Junpei Komiyama and Edouard Fouché and Junya Honda},
journal= {arXiv preprint arXiv:2107.11419},
year = {2023}
}
备注
Revision: Regret bound for ADR-Bandit + TS