中文

多臂老虎机分配不稳定性

机器学习 2026-02-10 v1 最优化与控制 概率论 机器学习

摘要

当多臂老虎机(MAB)算法在竞争性臂之间分配抽取次数时,结果分配可能呈现巨大的变动性。这在学习增强的平台操作和后-bandit统计推断等现代应用中尤为有害。因此,我们引入一种新的MAB算法绩效指标,称为分配变异性,即某臂抽取次数标准差的最大值(相对于各臂而言)。我们建立了分配变异性与后悔量之间的根本性权衡。具体而言,对于任何算法,最坏情况下的后悔量 RTR_T 和最坏情况下的分配变异性 STS_T 必须满足 RTST=Ω(T32)R_T \cdot S_T=\Omega(T^{\frac{3}{2}})TT\rightarrow\infty 时,只要 RT=o(T)R_T=o(T)。这表明,任何最小后悔-optimal算法都必须产生最坏情况下的分配变异性 Θ(T)\Theta(T),即最大可能的规模;而任何具有亚线性最坏情况后悔量的算法必然产生 ST=ω(T){S}_T= \omega(\sqrt{T})。我们进一步证明,该下界本质上是紧密的,且任何位于 Pareto 前沿 RTST=Θ~(T3/2)R_T \cdot S_T=\tilde{\Theta}(T^{3/2}) 的点都可以由一个简单的可调算法 UCB-f 实现,该算法是经典 UCB1 的一种推广。最后,我们讨论了在使用 bandit算法的情况下,平台操作和统计推断的影响。作为本结果的副产品,我们解决了 Praharaj 和 Khamaru (2025) 的一个开放问题。

关键词

引用

@article{arxiv.2602.07472,
  title  = {Bandit Allocational Instability},
  author = {Yilun Chen and Jiaqi Lu},
  journal= {arXiv preprint arXiv:2602.07472},
  year   = {2026}
}