固定预算下基于贝叶斯最优臂识别的 UCB 探索
机器学习
2024-10-24 v3 机器学习
摘要
我们研究了固定预算下的最优臂识别(BAI)。基于上置置信界(UCB)的自适应分配(如 UCBE)在 BAI 中已知效果良好。然而,众所周知,其最优后悔与实例相关,这在我们这里表明是许多固定预算 BAI 问题中的一种 artifacts。本文提出一种在贝叶斯设置下进行固定预算 BAI 的既在理论上又在实验上高效的 UCB 探索算法。关键思想是学习先验信息,这种做法就像在累积后悔最小化问题中那样能够提高 UCB-based BAI 算法的性能。我们对贝叶斯 BAI 问题建立了失败概率和简单后悔的上界,提供了约 的上界,其中 表示预算, 表示臂的数量。此外,我们通过实证结果表明,方法在持续优于最先进的基准方面。
引用
@article{arxiv.2408.04869,
title = {UCB Exploration for Fixed-Budget Bayesian Best Arm Identification},
author = {Rong J. B. Zhu and Yanqi Qiu},
journal= {arXiv preprint arXiv:2408.04869},
year = {2024}
}