针对指数分布的 UCB 算法
机器学习
2012-04-10 v1 机器学习
摘要
本文针对多臂赌博机(MAB)问题引入了一种新算法。MAB 是一种在认知网络相关课题(例如频谱感知与分配)中广受欢迎的机器学习范式。我们重点关注奖励服从指数分布的情形,这在处理瑞利衰落信道时很常见。该策略命名为乘法上置信界(MUCB),其为每个可用臂关联一个效用指标,并选择具有最高指标的臂。对于每个臂,其关联指标等于一个乘法因子与该臂所获奖励样本均值的乘积。我们证明 MUCB 策略具有低复杂度且是阶数最优的。
引用
@article{arxiv.1204.1624,
title = {UCB Algorithm for Exponential Distributions},
author = {Wassim Jouini and Christophe Moy},
journal= {arXiv preprint arXiv:1204.1624},
year = {2012}
}
备注
10 pages. Introduces Multiplicative Upper Confidence Bound (MUCB) algorithms for Multi-Armed Bandit problems