lil' UCB:一种用于多臂老虎机的最优探索算法
机器学习
2013-12-30 v1 机器学习
摘要
本文提出了一种新颖的上置信界 (UCB) 过程,旨在固定置信度设定下,利用少量总样本识别多臂老虎机游戏中具有最大均值的臂。该过程在某种意义上无法被改进,即识别最佳臂所需的样本量处于基于重对数律 (LIL) 的下界的常数因子范围内。受 LIL 启发,我们构建了置信界以明确考虑算法的无限时间视界。此外,通过为算法使用一种新颖的停止时间,我们避免了其他 UCB 类算法中观察到的对各臂的联合界。我们证明了该算法在常数因子意义下是最优的,并通过模拟表明其性能优于现有技术。
引用
@article{arxiv.1312.7308,
title = {lil' UCB : An Optimal Exploration Algorithm for Multi-Armed Bandits},
author = {Kevin Jamieson and Matthew Malloy and Robert Nowak and Sébastien Bubeck},
journal= {arXiv preprint arXiv:1312.7308},
year = {2013}
}