中文

一般成本与奖励分布下的预算约束赌博机

机器学习 2020-03-03 v1 机器学习

摘要

我们考虑一个预算约束的赌博机问题,其中每次拉动臂都会产生随机成本,并相应地获得随机奖励。目标是在总成本受预算约束的条件下最大化总期望奖励。该模型具有一般性,因为它允许相关且可能重尾的成本-奖励对,并且这些对可以取负值,正如许多应用所要求的那样。我们证明,如果所有成本-奖励对存在某个 γ>0\gamma > 0(2+γ)(2+\gamma) 阶矩,则对于预算 B>0B>0 可实现 O(logB)O(\log B) 后悔值。为了获得紧致的后悔界,我们提出了利用每臂成本与奖励之间相关性的算法,通过线性最小均方误差估计提取公共信息。我们证明了该问题的后悔下界,并表明所提算法达到了紧致的依赖于问题的后悔界,在联合高斯成本与奖励对的情况下最优至一个通用常数因子。

关键词

引用

@article{arxiv.2003.00365,
  title  = {Budget-Constrained Bandits over General Cost and Reward Distributions},
  author = {Semih Cayci and Atilla Eryilmaz and R. Srikant},
  journal= {arXiv preprint arXiv:2003.00365},
  year   = {2020}
}