中文

固定预算下的最佳臂识别:大偏差视角

机器学习 2024-02-21 v2 机器学习

摘要

我们考虑在固定采样预算下识别随机多臂老虎机(MABs)中最佳臂的问题。刻画该问题的最小实例特定错误概率构成了MABs中重要的剩余开放问题之一。当使用静态采样策略选择臂时,错误概率随样本数量呈指数衰减,其速率可以通过大偏差技术显式推导。然而,分析具有自适应采样策略的算法的性能更具挑战性。在本文中,我们建立了臂抽取的经验比例所满足的大偏差原理(LDP)与臂奖励的经验值所满足的大偏差原理之间的联系。这种联系适用于任何自适应算法,并被利用来改进一些现有算法的错误概率上界,例如著名的\sr(连续拒绝)算法 \citep{audibert2010best},以及设计和分析新算法。特别是,我们提出了\sred(连续拒绝),这是一种真正的自适应算法,它可以在任意轮次中基于观察到的各臂奖励之间的经验差距来拒绝臂。应用我们的大偏差结果,我们证明\sred享有比现有算法(包括\sr)更好的性能保证。广泛的数值实验证实了这一观察。

关键词

引用

@article{arxiv.2312.12137,
  title  = {Best Arm Identification with Fixed Budget: A Large Deviation Perspective},
  author = {Po-An Wang and Ruo-Chun Tzeng and Alexandre Proutiere},
  journal= {arXiv preprint arXiv:2312.12137},
  year   = {2024}
}

备注

We made small for implementing SH algorithm, now it has been corrected