线性赌博机中$\varepsilon$-最优臂识别的自适应能力研究
机器学习
2026-05-18 v1
摘要
我们研究了线性赌博机中-最优臂识别的极小极大样本复杂度。给定一个张成的紧致动作集和一个未知奖励向量,目标是输出一个臂,使得以至少的概率成立,并尽可能少地使用样本。首先,我们提出一种非自适应固定设计方法,其样本复杂度为,其中是依赖于的高斯宽度项,并证明了所有非自适应固定设计方法的下界为。随后,我们转向自适应采样。我们提出一个重要的结构性问题:除了标准基之外,是否存在结构化的动作集,使得自适应相对于最优非自适应速率仅能带来对数因子的改进?我们对几个自然动作集给出了肯定的回答,即超立方体、球、-集和多任务多臂赌博机。最后,我们首次构造了一个动作集,使得自适应相对于每一个非自适应算法都能带来多项式因子的改进。实现这种分离的一个关键要素是一个-范数估计子程序:我们设计了一个自适应算法,该算法从中的单位球中采样个样本,并输出一个估计值,使得以至少的概率成立,其中是未知的奖励向量。
引用
@article{arxiv.2605.15663,
title = {On the Power of Adaptivity for $\varepsilon$-Best Arm Identification in Linear Bandits},
author = {Arnab Maiti and Yunbei Xu and Kevin Jamieson},
journal= {arXiv preprint arXiv:2605.15663},
year = {2026}
}
备注
Accepted at COLT 2026