高斯_bandit_最优臂识别的非渐近方法
统计理论
2022-03-08 v2 机器学习
统计理论
摘要
我们提出了一种针对均值有界、方差为 1 的高斯变量在固定置信度下最优臂识别的新策略。该策略称为探索偏置采样(Exploration-Biased Sampling),不仅渐近最优:据我们所知,它是首个具有非渐近界且渐近匹配样本复杂度的策略。但与 Track-and-Stop 等其他算法相比,其主要优势在于改进的探索行为:探索偏置采样以微妙而自然的方式偏向探索,使其更稳定且可解释。这些改进得益于对样本复杂度优化问题的新分析,该分析给出了更快的数值求解方案以及若干定量正则性结果,我们相信这些结果具有高度独立意义。
引用
@article{arxiv.2105.12978,
title = {A Non-asymptotic Approach to Best-Arm Identification for Gaussian Bandits},
author = {Antoine Barrier and Aurélien Garivier and Tomáš Kocák},
journal= {arXiv preprint arXiv:2105.12978},
year = {2022}
}