具有可共享有限容量臂的多播放随机_bandit问题
机器学习
2022-06-20 v1 机器学习
摘要
我们将多播放多臂_bandit(MP-MAB)问题推广到可共享臂设定,其中若干次播放可共享同一臂。此外,每个可共享臂具有有限奖励容量与“每负载”奖励分布,二者均未知于学习器。可共享臂的奖励依赖于负载,即“每负载”奖励乘以拉取该臂的播放数,或当播放数超过容量限制时乘以其奖励容量。当“每负载”奖励服从高斯分布时,我们证明了从负载依赖奖励中学习容量的样本复杂度下界,以及该新MP-MAB问题的后悔下界。我们设计了一个容量估计器,其样本复杂度上界在奖励均值与容量意义上与下界匹配。我们还提出一种在线学习算法以解决该问题并证明其后悔上界。该后悔上界的第一项与后悔下界相同,其第二与第三项亦明显对应于下界。大量实验验证了算法的性能及其在5G与4G基站选择中的增益。
引用
@article{arxiv.2206.08776,
title = {Multiple-Play Stochastic Bandits with Shareable Finite-Capacity Arms},
author = {Xuchuang Wang and Hong Xie and John C. S. Lui},
journal= {arXiv preprint arXiv:2206.08776},
year = {2022}
}
备注
to appear in ICML 2022