中文

单遍流式随机多臂老虎机的紧致间隙依赖内存-遗憾权衡

机器学习 2025-03-05 v1 数据结构与算法 机器学习

摘要

我们研究了单遍流式随机多臂老虎机(MAB)中间隙依赖遗憾的最小化问题。在该问题中,nn 个臂存在于一个数据流中,且最多只能将 m<nm<n 个臂及其统计信息存储在内存中。我们针对所有相关参数建立了紧致的非渐近遗憾界,包括臂的数量 nn、内存大小 mm、轮数 TT 以及 (Δi)i[n](\Delta_i)_{i\in [n]},其中 Δi\Delta_i 是最优臂与第 ii 个臂之间的奖励均值间隙。玩家事先并不知道这些间隙。具体而言,对于任意常数 α1\alpha \ge 1,我们提出了两种算法:一种适用于 m23nm\ge \frac{2}{3}n 的情况,其遗憾至多为 Oα((nm)T1α+1n1+1α+1i:Δi>0Δi12α)O_\alpha\Big(\frac{(n-m)T^{\frac{1}{\alpha + 1}}}{n^{1 + {\frac{1}{\alpha + 1}}}}\displaystyle\sum_{i:\Delta_i > 0}\Delta_i^{1 - 2\alpha}\Big);另一种适用于 m<23nm<\frac{2}{3}n 的情况,其遗憾至多为 Oα(T1α+1m1α+1i:Δi>0Δi12α)O_\alpha\Big(\frac{T^{\frac{1}{\alpha+1}}}{m^{\frac{1}{\alpha+1}}}\displaystyle\sum_{i:\Delta_i > 0}\Delta_i^{1 - 2\alpha}\Big)。我们还通过证明对于任意常数 α1\alpha\ge 1 和任意 mk<nm\leq k < n,存在一组困难实例使得任何算法的遗憾为 Ωα((km+1)T1α+1k1+1α+1i:Δi>0Δi12α)\Omega_\alpha\Big(\frac{(k-m+1) T^{\frac{1}{\alpha+1}}}{k^{1 + \frac{1}{\alpha+1}}} \sum_{i:\Delta_i > 0}\Delta_i^{1-2\alpha}\Big),从而为这两种情况给出了匹配的下界。这是流式 MAB 首个紧致的间隙依赖遗憾界。在我们的工作之前,Agarwal, Khanna 和 Patil (COLT'22) 针对特殊情形 α=1\alpha=1m=O(1)m=O(1) 建立了 O(i ⁣:Δ>0TlogTΔi)O\Big(\sum_{i\colon\Delta>0} \frac{\sqrt{T}\log T}{\Delta_i}\Big) 的上界。相比之下,我们的结果给出了正确的遗憾阶数 Θ(1mi ⁣:Δ>0TΔi)\Theta\Big(\frac{1}{\sqrt{m}}\sum_{i\colon\Delta>0}\frac{\sqrt{T}}{\Delta_i}\Big)

关键词

引用

@article{arxiv.2503.02428,
  title  = {Tight Gap-Dependent Memory-Regret Trade-Off for Single-Pass Streaming Stochastic Multi-Armed Bandits},
  author = {Zichun Ye and Chihao Zhang and Jiahao Zhao},
  journal= {arXiv preprint arXiv:2503.02428},
  year   = {2025}
}