中文

固定预算下基于贝叶斯最优臂识别的 UCB 探索

机器学习 2024-10-24 v3 机器学习

摘要

我们研究了固定预算下的最优臂识别(BAI)。基于上置置信界(UCB)的自适应分配(如 UCBE)在 BAI 中已知效果良好。然而,众所周知,其最优后悔与实例相关,这在我们这里表明是许多固定预算 BAI 问题中的一种 artifacts。本文提出一种在贝叶斯设置下进行固定预算 BAI 的既在理论上又在实验上高效的 UCB 探索算法。关键思想是学习先验信息,这种做法就像在累积后悔最小化问题中那样能够提高 UCB-based BAI 算法的性能。我们对贝叶斯 BAI 问题建立了失败概率和简单后悔的上界,提供了约 O~(K/n)\tilde{O}(\sqrt{K/n}) 的上界,其中 nn 表示预算,KK 表示臂的数量。此外,我们通过实证结果表明,方法在持续优于最先进的基准方面。

关键词

引用

@article{arxiv.2408.04869,
  title  = {UCB Exploration for Fixed-Budget Bayesian Best Arm Identification},
  author = {Rong J. B. Zhu and Yanqi Qiu},
  journal= {arXiv preprint arXiv:2408.04869},
  year   = {2024}
}