中文

重访多保真多臂_bandit问题

机器学习 2023-06-14 v1 机器学习

摘要

我们研究多保真多臂_bandit(MF-MAB),它是标准多臂_bandit(MAB)问题的扩展。MF-MAB允许以不同代价(保真度)和观测精度抽取每根臂。我们同时研究固定置信度下最佳臂辨识(BAI)和后悔最小化两个目标。对于BAI,我们给出(a)代价复杂度下界,(b)带两种可选保真度选择程序的算法框架,以及(c)两种程序的代价复杂度上界。由MF-MAB的这两个代价复杂度界,均可恢复经典(单保真)MAB的标准样本复杂度界。对于MF-MAB的后悔最小化,我们提出一种新的后悔定义,证明其问题无关后悔下界 Ω(K1/3Λ2/3)\Omega(K^{1/3}\Lambda^{2/3}) 与问题相关下界 Ω(KlogΛ)\Omega(K\log \Lambda),其中 KK 为臂数、Λ\Lambda 为以代价计的决策预算,并设计了一种基于消除的算法,其最坏代价后悔上界在相差若干对数项内匹配相应下界,且其问题相关上界在 Λ\Lambda 项上匹配相应下界。

关键词

引用

@article{arxiv.2306.07761,
  title  = {Multi-Fidelity Multi-Armed Bandits Revisited},
  author = {Xuchuang Wang and Qingyun Wu and Wei Chen and John C. S. Lui},
  journal= {arXiv preprint arXiv:2306.07761},
  year   = {2023}
}