中文

加性高斯噪声下通信受限的多臂老虎机

机器学习 2023-06-07 v2 信息论 math.IT 机器学习

摘要

我们研究了一种分布式随机多臂老虎机,其中客户端基于对应臂拉动的奖励向学习器提供通信受限的反馈。在我们的设定中,客户端必须对奖励进行编码,使得编码奖励的二阶矩不超过 PP,且该编码奖励进一步被方差为 σ2\sigma^2 的加性高斯噪声破坏;学习器只能访问此被破坏的奖励。针对该设定,我们推导了任意方案极小极大后悔的下界 Ω(KTSNR1)\Omega\left(\sqrt{\frac{KT}{\mathtt{SNR} \wedge1}} \right),其中 SNR:=Pσ2 \mathtt{SNR} := \frac{P}{\sigma^2}KKTT 分别为臂的数量和时间范围。此外,我们提出了一种多阶段老虎机算法 UE-UCB++\mathtt{UE\text{-}UCB++},其在次要附加因子意义上与该下界匹配。UE-UCB++\mathtt{UE\text{-}UCB++} 在初始阶段执行均匀探索,随后在最终阶段利用{\em 上置信界}(UCB) 老虎机算法。UE-UCB++\mathtt{UE\text{-}UCB++} 的一个有趣特征是,在均匀探索阶段形成的较粗奖励均值估计有助于改进下一阶段的编码协议,从而在后续阶段获得更精确的奖励均值估计。这种正反馈循环对于减少均匀探索轮数并紧密匹配我们的下界至关重要。

关键词

引用

@article{arxiv.2304.12680,
  title  = {Communication-Constrained Bandits under Additive Gaussian Noise},
  author = {Prathamesh Mayekar and Jonathan Scarlett and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2304.12680},
  year   = {2023}
}