关于老虎机中的有限记忆子采样策略
人工智能
2021-06-22 v1 机器学习
摘要
近年来,基于子采样的非参数老虎机算法引起了广泛关注。然而,这些方法的一个缺陷是随机子采样所需的额外复杂性以及存储完整奖励历史的需要。我们的第一个贡献是证明 Baudry 等人 (2020) 在近期工作中以“最后块子采样”之名提出的一种简单确定性子采样规则,在一参数指数族中是渐近最优的。此外,我们证明当将算法记忆限制为时间范围的 polylogarithmic 函数时,这些保证同样成立。这些发现开辟了新的视角,特别是在臂分布随时间演化的非平稳场景中。我们提出了该算法的一个变体,其中仅使用最近的观测进行子采样,在已知突变次数假设下实现了最优后悔保证。大量的数值模拟凸显了该方法的长处,尤其是在变化不仅影响奖励均值时。
引用
@article{arxiv.2106.10935,
title = {On Limited-Memory Subsampling Strategies for Bandits},
author = {Dorian Baudry and Yoan Russac and Olivier Cappé},
journal= {arXiv preprint arXiv:2106.10935},
year = {2021}
}