中文

深入考察多臂老虎机算法的最坏情况行为

机器学习 2021-10-27 v3 机器学习

摘要

经典(随机)多臂老虎机(MAB)问题复杂性的关键驱动因素之一是前两名臂的平均奖励之差,也称为实例间隙。著名的置信上界(UCB)策略是最简单的基于乐观的 MAB 算法之一,它自然适应此间隙:对于游玩时长 n,在间隙“大”的实例中它实现最优的 O(log n) 遗憾,而在间隙可任意“小”时实现近最优的 O(\sqrt{n log n}) 极小极大遗憾。本文提供了关于 UCB 下臂采样行为的新结果,带来了若干重要见解。其中表明,无论问题复杂性如何,UCB 下的臂采样率渐近确定。这一发现促进了新的尖锐渐近性以及对 UCB 的 O(\sqrt{n log n}) 极小极大遗憾的新颖替代证明。此外,本文还首次在常规扩散缩放下给出了 UCB 下 MAB 问题的完整过程级刻画。除此之外,本文采用的“小”间隙最坏情况视角也揭示了 UCB 与 Thompson Sampling 行为之间的深刻区别,例如后者特有的“不完全学习”现象。

关键词

引用

@article{arxiv.2106.02126,
  title  = {A Closer Look at the Worst-case Behavior of Multi-armed Bandit Algorithms},
  author = {Anand Kalvit and Assaf Zeevi},
  journal= {arXiv preprint arXiv:2106.02126},
  year   = {2021}
}