中文

针对非退化函数的分批随机 Bandit 算法

机器学习 2025-04-09 v3 机器学习

摘要

本文研究非退化函数的分批 bandit 学习问题。我们引入了一种算法,能够近似最优地解决非退化函数的分批 bandit 问题。更具体地,我们引入了一种称为 Geometric Narrowing (GN) 的算法,其遗憾界为 O~(A+dT)\widetilde{{\mathcal{O}}} ( A_{+}^d \sqrt{T} ) 阶。此外,GN 只需要 O(loglogT)\mathcal{O} (\log \log T) 个批次即可达到该遗憾。我们还对该问题提供了下界分析。更具体地,我们证明在某个倍维数为 dd 的(紧致)倍增度量空间上:1. 对于任意策略 π\pi,存在一个问题实例,使得 π\pi 在其上产生 Ω(AdT)\Omega ( A_-^d \sqrt{T}) 阶的遗憾;2. 没有任何策略能够在所有问题实例上,使用少于 Ω(loglogT)\Omega ( \log \log T ) 轮通信实现 AdT A_-^d \sqrt{T} 阶的遗憾。我们的下界分析表明,GN 算法以最少的批次实现了近似最优的遗憾。

关键词

引用

@article{arxiv.2405.05733,
  title  = {Batched Stochastic Bandit for Nondegenerate Functions},
  author = {Yu Liu and Yunlu Shu and Tianyu Wang},
  journal= {arXiv preprint arXiv:2405.05733},
  year   = {2025}
}

备注

34 pages, 14 colored figures