流式多臂老虎机探索中已知最优间隙的近紧界
机器学习
2025-02-04 v1 数据结构与算法
摘要
我们研究多次遍历流式多臂老虎机(MAB)中纯探索的样本-内存-遍历权衡。假设已知最优间隙。这里,最优间隙定义为最佳臂与第i佳臂之间的平均奖励间隙。在Jin、Huang、Tang和Xiao[ICML'21]和Assadi和Wang[COLT'24]的最新研究中表明,如果没有已知,则需要(最多项)的遍历复杂度才能获得的最坏情况最优样本复杂度,并以单臂内存实现。然而,对已知的多遍历算法的理解仍有限。本文的关键开放问题是:在次线性内存规模下,实现复杂度臂拉取所需的遍历次数是多少。我们证明,答案是(最多项)。我们首先给出下界,表明任何寻找最佳臂且仅使用次线性内存(即内存为臂)且臂拉取次数为的算法都需要次遍历。随后我们给出一个近似匹配的算法,假设已知,以臂拉取和*单臂*内存找到最佳臂。
引用
@article{arxiv.2502.01067,
title = {Nearly Tight Bounds for Exploration in Streaming Multi-armed Bandits with Known Optimality Gap},
author = {Nikolai Karpov and Chen Wang},
journal= {arXiv preprint arXiv:2502.01067},
year = {2025}
}
备注
AAAI 2025