中文

少量批次或少量内存,但两者不可兼得:随机多臂老虎机中的空间与自适应性约束

机器学习 2026-03-31 v2 机器学习

摘要

我们研究在同时约束空间和自适应性的情况下进行的随机多臂老虎机问题:学习者在 BB 个批次中与环境交互,且仅拥有 WW 位的持久内存。先前工作表明,单个约束本身相当温和:在完全自适应交互下,可在 O(logT)O(\log T) 位内存下实现接近最小后悔的 O~(KT)\widetilde{O}(\sqrt{KT});而在内存不受限制时,可在 KK 无关的 O(loglogT)O(\log\log T) 级别批次数下实现类似效果。我们指出,这一图景在同时受限的情况下会崩溃。我们证明,任何受 WW 位内存约束的算法都必须使用至少 Ω(K/W)\Omega(K/W) 个批次才能实现接近最小后悔的 O~(KT)\widetilde{O}(\sqrt{KT}),即便在自适应网格下如此。特别是, Logarithmic 内存会排除 O(K1ε)O(K^{1-\varepsilon}) 级别的批次复杂度。我们的证明基于信息瓶颈。我们表明,接近最小后悔迫使学习者在合适的硬 prior 下获取 Ω(K)\Omega(K) 位关于隐藏的优势臂的信息,而拥有 BB 个批次和 WW 位内存的算法只能获取 O(BW)O(BW) 位信息。关键要素是一种局部化的变更测度引理,可提供面向臂探索的概率层次保证,这本身亦具独立的兴趣。我们还给出一种算法,对任意 bit 预算 WW(满足 Ω(logT)WO(KlogT)\Omega(\log T) \le W \le O(K\log T)),最多使用 WW 位内存,即可在 O~(K/W)\widetilde{O}(K/W) 批次下实现后悔 O~(KT)\widetilde{O}(\sqrt{KT}),几乎匹配下界(在多项式对数因子上)。

关键词

引用

@article{arxiv.2603.13742,
  title  = {Few Batches or Little Memory, But Not Both: Simultaneous Space and Adaptivity Constraints in Stochastic Bandits},
  author = {Ruiyuan Huang and Zicheng Lyu and Xiaoyi Zhu and Zengfeng Huang},
  journal= {arXiv preprint arXiv:2603.13742},
  year   = {2026}
}