中文

受限控制变量的随机多臂老虎机问题

机器学习 2026-03-03 v1

摘要

受无线网络中干扰或信道状态估计提供的部分见解的启发,我们研究了经典随机多臂老虎机问题的一个变体:学习者仅对辅助信息拥有有限获取权限。近期工作表明,当辅助信息以控制变量形式可用时,可用于获得更紧致的置信区间,从而实现更低的后悔 regret。然而,现有工作假设控制变量在每一轮都可用,这在Several实际场景中可能不现实。为此,我们提出UCB-LCV算法,该算法有效地结合来自奖励和控制变量所得的估计器。当不存在控制变量时,UCB-LCV导致我们提出的一种新算法,即UCB-NORMAL,超越了标准 MAB 设置下使用正态分布奖励的现有算法。最后,我们讨论了适用于一般分布的UCB-LCV变体,并实验性地展示UCB-LCV在多个实验中均优于现有老虎机算法。

关键词

引用

@article{arxiv.2603.02100,
  title  = {Stochastic Multi-Armed Bandits with Limited Control Variates},
  author = {Arun Verma and Manjesh Kumar Hanawal and Arun Rajkumar},
  journal= {arXiv preprint arXiv:2603.02100},
  year   = {2026}
}

备注

Accepted at COMSNETS 2026