中文

线性赌博机中$\varepsilon$-最优臂识别的自适应能力研究

机器学习 2026-05-18 v1

摘要

我们研究了线性赌博机中ε\varepsilon-最优臂识别的极小极大样本复杂度。给定一个张成Rd\mathbb{R}^d的紧致动作集X\mathcal{X}和一个未知奖励向量θRd\theta\in\mathbb{R}^d,目标是输出一个臂x^X\widehat{x}\in\mathcal{X},使得x^,θmaxxXx,θε\langle \widehat{x},\theta\rangle \ge \max_{x\in\mathcal{X}} \langle x,\theta\rangle - \varepsilon以至少1δ1-\delta的概率成立,并尽可能少地使用样本。首先,我们提出一种非自适应固定设计方法,其样本复杂度为O ⁣(dlog(1/δ)ε2+w(X)2ε2)\mathcal{O}\!\left(\frac{d\log(1/\delta)}{\varepsilon^2}+\frac{w(\mathcal{X})^2}{\varepsilon^2}\right),其中w(X)w(\mathcal{X})是依赖于X\mathcal{X}的高斯宽度项,并证明了所有非自适应固定设计方法的下界为Ω ⁣(dlog(1/δ)ε2+w(X)2ε2)\Omega\!\left(\frac{d\log(1/\delta)}{\varepsilon^2}+\frac{w(\mathcal{X})^2}{\varepsilon^2}\right)。随后,我们转向自适应采样。我们提出一个重要的结构性问题:除了标准基之外,是否存在结构化的动作集,使得自适应相对于最优非自适应速率仅能带来对数因子的改进?我们对几个自然动作集给出了肯定的回答,即超立方体、2\ell_2球、mm-集和多任务多臂赌博机。最后,我们首次构造了一个动作集X\mathcal{X},使得自适应相对于每一个非自适应算法都能带来多项式因子的改进。实现这种分离的一个关键要素是一个2\ell_2-范数估计子程序:我们设计了一个自适应算法,该算法从Rd\mathbb{R}^d中的单位2\ell_2球中采样O ⁣(dlog(1/δ)ε2)\mathcal{O}\!\left(\frac{d\log(1/\delta)}{\varepsilon^2}\right)个样本,并输出一个估计值r^\widehat r,使得r^θ2ε|\widehat r-\|\theta\|_2|\le \varepsilon以至少1δ1-\delta的概率成立,其中θ\theta是未知的奖励向量。

关键词

引用

@article{arxiv.2605.15663,
  title  = {On the Power of Adaptivity for $\varepsilon$-Best Arm Identification in Linear Bandits},
  author = {Arnab Maiti and Yunbei Xu and Kevin Jamieson},
  journal= {arXiv preprint arXiv:2605.15663},
  year   = {2026}
}

备注

Accepted at COLT 2026