中文

流式多臂老虎机探索中已知最优间隙的近紧界

机器学习 2025-02-04 v1 数据结构与算法

摘要

我们研究多次遍历流式多臂老虎机(MAB)中纯探索的样本-内存-遍历权衡。假设已知最优间隙Δ[2]\Delta_{[2]}。这里,最优间隙Δ[i]\Delta_{[i]}定义为最佳臂与第i佳臂之间的平均奖励间隙。在Jin、Huang、Tang和Xiao[ICML'21]和Assadi和Wang[COLT'24]的最新研究中表明,如果没有已知Δ[2]\Delta_{[2]},则需要Θ(log(1/Δ[2]))\Theta(\log(1/\Delta_{[2]}))(最多loglog(1/Δ[2])\log\log(1/\Delta_{[2]})项)的遍历复杂度才能获得O(n/Δ[2]2)O(n/\Delta^{2}_{[2]})的最坏情况最优样本复杂度,并以单臂内存实现。然而,对已知Δ[2]\Delta_{[2]}的多遍历算法的理解仍有限。本文的关键开放问题是:在次线性内存规模下,实现复杂度O(i=2n1/Δ[i]2)O(\sum_{i=2}^{n}1/\Delta^2_{[i]})臂拉取所需的遍历次数是多少。我们证明,答案是Θ(logn)\Theta(\log{n})(最多loglogn\log\log{n}项)。我们首先给出下界,表明任何寻找最佳臂且仅使用次线性内存(即内存为o(n/polylog(n))o({n}/{\text{polylog}({n})})臂)且臂拉取次数为O(i=2n1/Δ[i]2log(n))O(\sum_{i=2}^{n}{1}/{\Delta^{2}_{[i]}}\cdot \log{(n)})的算法都需要Ω(lognloglogn)\Omega(\frac{\log{n}}{\log\log{n}})次遍历。随后我们给出一个近似匹配的算法,假设已知Δ[2]\Delta_{[2]},以O(i=2n1/Δ[i]2logn)O(\sum_{i=2}^{n}1/\Delta^2_{[i]} \cdot \log{n})臂拉取和*单臂*内存找到最佳臂。

关键词

引用

@article{arxiv.2502.01067,
  title  = {Nearly Tight Bounds for Exploration in Streaming Multi-armed Bandits with Known Optimality Gap},
  author = {Nikolai Karpov and Chen Wang},
  journal= {arXiv preprint arXiv:2502.01067},
  year   = {2025}
}

备注

AAAI 2025