一般成本与奖励分布下的预算约束赌博机
机器学习
2020-03-03 v1 机器学习
摘要
我们考虑一个预算约束的赌博机问题,其中每次拉动臂都会产生随机成本,并相应地获得随机奖励。目标是在总成本受预算约束的条件下最大化总期望奖励。该模型具有一般性,因为它允许相关且可能重尾的成本-奖励对,并且这些对可以取负值,正如许多应用所要求的那样。我们证明,如果所有成本-奖励对存在某个 的 阶矩,则对于预算 可实现 后悔值。为了获得紧致的后悔界,我们提出了利用每臂成本与奖励之间相关性的算法,通过线性最小均方误差估计提取公共信息。我们证明了该问题的后悔下界,并表明所提算法达到了紧致的依赖于问题的后悔界,在联合高斯成本与奖励对的情况下最优至一个通用常数因子。
引用
@article{arxiv.2003.00365,
title = {Budget-Constrained Bandits over General Cost and Reward Distributions},
author = {Semih Cayci and Atilla Eryilmaz and R. Srikant},
journal= {arXiv preprint arXiv:2003.00365},
year = {2020}
}