关于所有 ε-最优臂辨识的复杂度
机器学习
2022-04-07 v2 机器学习
摘要
我们考虑由 \cite{Mason2020} 提出的在具有高斯奖励的有限随机多臂 bandit 中辨识所有 -最优臂的问题。我们给出了任何以至少 置信度解决该问题的算法在样本复杂度上的两个下界。第一个在渐近 regime 下不可改进,激励我们设计一种 Track-and-Stop 策略,其在风险 趋于零时平均样本复杂度渐近最优。值得注意的是,我们提供了一种高效数值方法来求解下界中出现的凸 max-min 规划。我们的方法基于对最优采样策略需要排除的替代 bandit 实例的完整刻画,从而使我们的下界比 \cite{Mason2020} 提供的更紧。第二个下界处理高风险和中等风险 的 regime,并刻画了任何算法在初始阶段的行为。它强调了样本复杂度对臂数量的线性依赖。最后,我们报告了数值模拟,证明了即使在中等风险下,我们的算法相对于最先进方法的优势。
引用
@article{arxiv.2202.06280,
title = {On the complexity of All $\varepsilon$-Best Arms Identification},
author = {Aymen Al Marjani and Tomáš Kocák and Aurélien Garivier},
journal= {arXiv preprint arXiv:2202.06280},
year = {2022}
}