中文

高斯_bandit_最优臂识别的非渐近方法

统计理论 2022-03-08 v2 机器学习 统计理论

摘要

我们提出了一种针对均值有界、方差为 1 的高斯变量在固定置信度下最优臂识别的新策略。该策略称为探索偏置采样(Exploration-Biased Sampling),不仅渐近最优:据我们所知,它是首个具有非渐近界且渐近匹配样本复杂度的策略。但与 Track-and-Stop 等其他算法相比,其主要优势在于改进的探索行为:探索偏置采样以微妙而自然的方式偏向探索,使其更稳定且可解释。这些改进得益于对样本复杂度优化问题的新分析,该分析给出了更快的数值求解方案以及若干定量正则性结果,我们相信这些结果具有高度独立意义。

关键词

引用

@article{arxiv.2105.12978,
  title  = {A Non-asymptotic Approach to Best-Arm Identification for Gaussian Bandits},
  author = {Antoine Barrier and Aurélien Garivier and Tomáš Kocák},
  journal= {arXiv preprint arXiv:2105.12978},
  year   = {2022}
}