中文

对抗性多臂赌博机中的前瞻识别:精度与记忆界限

机器学习 2026-03-03 v1

摘要

我们研究多臂赌博机中的一个识别问题。在每一轮,学习者选择 KK 个臂之一并观察其奖励,目标是最终识别一个在{\it 未来}时间将表现最佳的臂。然而,在对抗性环境中,过去的表现可能为揭示未来提供很少信息,这引出了一个问题:在对抗性环境中是否可能实现有意义的识别。本文中,我们引入前瞻识别任务,学习者的目标是选择一个未来的预测窗口并提前提交一个臂,其在该窗口内的平均奖励在 ε\varepsilon 以内。我们的分析刻画了前瞻识别可达到的精度以及获得其所需的记忆资源。从精度角度看,对于任意时域 TT,我们给出一种算法实现 ε=O(1/logT)\varepsilon = O\bigl(1/\sqrt{\log T}\bigr),覆盖 Ω(T)\Omega(\sqrt{T}) 个预测窗口。这表明,或许出乎意料,尽管信息显著不足,仍然可能在对抗性环境中实现识别。我们还证明了接近匹配的下界,表明 ε=Ω(1/logT)\varepsilon = \Omega\bigl(1/\log T\bigr) 是不可避免的。随后我们考察记忆在我们问题中的作用,首先证明任何实现非平凡精度的算法都需要 Ω(K)\Omega(K) 位的记忆。在一种自然的局部稀疏性条件下,我们表明可以使用仅多对数记忆即可实现相同的精度保证。

关键词

引用

@article{arxiv.2603.00803,
  title  = {Lookahead identification in adversarial bandits: accuracy and memory bounds},
  author = {Nataly Brukhim and Nicolò Cesa-Bianchi and Carlo Ciliberto},
  journal= {arXiv preprint arXiv:2603.00803},
  year   = {2026}
}