深入考察多臂老虎机算法的最坏情况行为
机器学习
2021-10-27 v3 机器学习
摘要
经典(随机)多臂老虎机(MAB)问题复杂性的关键驱动因素之一是前两名臂的平均奖励之差,也称为实例间隙。著名的置信上界(UCB)策略是最简单的基于乐观的 MAB 算法之一,它自然适应此间隙:对于游玩时长 n,在间隙“大”的实例中它实现最优的 O(log n) 遗憾,而在间隙可任意“小”时实现近最优的 O(\sqrt{n log n}) 极小极大遗憾。本文提供了关于 UCB 下臂采样行为的新结果,带来了若干重要见解。其中表明,无论问题复杂性如何,UCB 下的臂采样率渐近确定。这一发现促进了新的尖锐渐近性以及对 UCB 的 O(\sqrt{n log n}) 极小极大遗憾的新颖替代证明。此外,本文还首次在常规扩散缩放下给出了 UCB 下 MAB 问题的完整过程级刻画。除此之外,本文采用的“小”间隙最坏情况视角也揭示了 UCB 与 Thompson Sampling 行为之间的深刻区别,例如后者特有的“不完全学习”现象。
引用
@article{arxiv.2106.02126,
title = {A Closer Look at the Worst-case Behavior of Multi-armed Bandit Algorithms},
author = {Anand Kalvit and Assaf Zeevi},
journal= {arXiv preprint arXiv:2106.02126},
year = {2021}
}