多臂老虎机分配不稳定性
机器学习
2026-02-10 v1 最优化与控制
概率论
机器学习
摘要
当多臂老虎机(MAB)算法在竞争性臂之间分配抽取次数时,结果分配可能呈现巨大的变动性。这在学习增强的平台操作和后-bandit统计推断等现代应用中尤为有害。因此,我们引入一种新的MAB算法绩效指标,称为分配变异性,即某臂抽取次数标准差的最大值(相对于各臂而言)。我们建立了分配变异性与后悔量之间的根本性权衡。具体而言,对于任何算法,最坏情况下的后悔量 和最坏情况下的分配变异性 必须满足 当 时,只要 。这表明,任何最小后悔-optimal算法都必须产生最坏情况下的分配变异性 ,即最大可能的规模;而任何具有亚线性最坏情况后悔量的算法必然产生 。我们进一步证明,该下界本质上是紧密的,且任何位于 Pareto 前沿 的点都可以由一个简单的可调算法 UCB-f 实现,该算法是经典 UCB1 的一种推广。最后,我们讨论了在使用 bandit算法的情况下,平台操作和统计推断的影响。作为本结果的副产品,我们解决了 Praharaj 和 Khamaru (2025) 的一个开放问题。
引用
@article{arxiv.2602.07472,
title = {Bandit Allocational Instability},
author = {Yilun Chen and Jiaqi Lu},
journal= {arXiv preprint arXiv:2602.07472},
year = {2026}
}