中文

在奖励未知且随机的臂上分配可分割资源

机器学习 2023-11-06 v2 统计理论 机器学习 统计理论

摘要

我们考虑一个决策者在每一期将一单位可再生且可分割的资源分配给若干个臂。这些臂具有未知且随机的奖励,其均值与所分配资源成正比,方差与所分配资源的bb阶成正比。特别地,若决策者在某期向臂ii分配资源AiA_i,则奖励YiY_iYi(Ai)=Aiμi+AibξiY_i(A_i)=A_i \mu_i+A_i^b \xi_{i},其中μi\mu_i为未知均值,噪声ξi\xi_{i}独立且次高斯。当阶数bb介于0到1之间时,该框架平滑地桥接了标准随机多臂老虎机与带全反馈的在线学习。我们设计了两种算法,对b[0,1]b\in [0,1]取得了最优的依赖于间隙和独立于间隙的遗憾界,并展示了在b=1/2b=1/2处的相变。理论结果依赖于我们新近发展的一个集中不等式,其界定了权重为分数、适应于滤波且单调的次高斯随机变量的线性组合。

关键词

引用

@article{arxiv.2306.16578,
  title  = {Allocating Divisible Resources on Arms with Unknown and Random Rewards},
  author = {Ningyuan Chen and Wenhao Li},
  journal= {arXiv preprint arXiv:2306.16578},
  year   = {2023}
}