中文

具有资源消耗删失的多臂老虎机问题

机器学习 2022-10-18 v2 机器学习

摘要

我们考虑经典多臂老虎机问题的一种资源感知变体:每轮中,学习者选择一个臂并设定一个资源上限。随后,若(随机的)资源消耗量低于该上限,则观察到相应的(随机)奖励;否则观测被删失,即无法获得奖励。针对此问题设定,我们引入了一种后悔度量,其纳入了每轮学习实际分配的资源量以及可实现奖励的最优性。因此,为最小化后悔,学习者需要设定资源上限并选择臂,使得在预定资源上限内实现高奖励的概率较高,同时资源上限本身应尽可能低。我们提出了一种受 UCB 启发的在线学习算法,并从理论上分析了其后悔上界。在仿真研究中,我们表明该学习算法优于标准多臂老虎机算法的直接扩展。

关键词

引用

@article{arxiv.2011.00813,
  title  = {Multi-Armed Bandits with Censored Consumption of Resources},
  author = {Viktor Bengs and Eyke Hüllermeier},
  journal= {arXiv preprint arXiv:2011.00813},
  year   = {2022}
}