重访多保真多臂_bandit问题
机器学习
2023-06-14 v1 机器学习
摘要
我们研究多保真多臂_bandit(MF-MAB),它是标准多臂_bandit(MAB)问题的扩展。MF-MAB允许以不同代价(保真度)和观测精度抽取每根臂。我们同时研究固定置信度下最佳臂辨识(BAI)和后悔最小化两个目标。对于BAI,我们给出(a)代价复杂度下界,(b)带两种可选保真度选择程序的算法框架,以及(c)两种程序的代价复杂度上界。由MF-MAB的这两个代价复杂度界,均可恢复经典(单保真)MAB的标准样本复杂度界。对于MF-MAB的后悔最小化,我们提出一种新的后悔定义,证明其问题无关后悔下界 与问题相关下界 ,其中 为臂数、 为以代价计的决策预算,并设计了一种基于消除的算法,其最坏代价后悔上界在相差若干对数项内匹配相应下界,且其问题相关上界在 项上匹配相应下界。
引用
@article{arxiv.2306.07761,
title = {Multi-Fidelity Multi-Armed Bandits Revisited},
author = {Xuchuang Wang and Qingyun Wu and Wei Chen and John C. S. Lui},
journal= {arXiv preprint arXiv:2306.07761},
year = {2023}
}