随机上升_bandit的最优臂辨识
机器学习
2024-05-29 v3
摘要
随机上升_bandit(SRB)对序贯决策问题建模,其中可用选项的期望奖励在每次被选中时都会增加。该设定涵盖广泛场景,其中可用选项是学习实体,其性能随时间(在期望意义上)提升(例如在线最佳模型选择)。先前工作关注遗憾最小化问题,本文则聚焦于SRB的固定预算最优臂辨识(BAI)问题。在该场景中,给定固定的轮次预算,我们需在辨识过程结束时给出关于最佳选项的推荐。我们提出两种算法来解决上述设定,即采用类UCB方法的R-UCBE,以及采用连续拒绝过程的R-SR。随后我们证明,在预算足够大时,它们能对学习过程结束时正确辨识最优选项的概率以及简单遗憾提供保证。此外,我们推导了错误概率的下界,该下界由我们的R-SR(至多差常数因子)匹配,并阐明在SRB设定中需要足够大预算的不可避免性。最后,我们在合成与真实环境中对提出的算法进行了数值验证。
引用
@article{arxiv.2302.07510,
title = {Best Arm Identification for Stochastic Rising Bandits},
author = {Marco Mussi and Alessandro Montenegro and Francesco Trovó and Marcello Restelli and Alberto Maria Metelli},
journal= {arXiv preprint arXiv:2302.07510},
year = {2024}
}
备注
Accepted to ICML 2024