中文

基于 UCB 探索的可复制 Bandit 算法

机器学习 2026-04-23 v1

摘要

我们研究了基于 UCB(Upper Confidence Bound,置信上界)探索的随机多臂 Bandit(MAB)与线性 Bandit 的可复制算法。如果两次执行共享内部随机性但奖励实现相互独立,且以至少 1ρ1-\rho 的概率产生相同的动作序列,则称该 Bandit 算法是 ρ\rho-可复制的。先前的工作主要基于淘汰策略,且在具有无限多动作的线性 Bandit 中依赖于离散化,导致对维度 ddρ\rho 的依赖关系是次优的。我们为这两种设定开发了乐观替代方案。对于随机多臂 Bandit,我们提出了 RepUCB,一种可复制的批量 UCB 算法,并证明其遗憾为 O ⁣(K2log2Tρ2a:Δa>0(Δa+log(KTlogT)Δa))O\!\left(\frac{K^2\log^2 T}{\rho^2}\sum_{a:\Delta_a>0}\left(\Delta_a+\frac{\log(KT\log T)}{\Delta_a}\right)\right)。对于随机线性 Bandit,我们首先引入了 RepRidge,一种可复制的岭回归估计器,同时满足置信度保证和 ρ\rho-可复制性保证。除了在我们的 Bandit 算法中发挥作用外,该估计器及其保证在其他统计估计设定中也可能具有独立的意义。随后,我们利用 RepRidge 设计了 RepLinUCB,一种用于随机线性 Bandit 的可复制乐观算法,并证明其遗憾被 O~ ⁣((d+d3ρ)T)\widetilde{O}\!\big(\big(d+\frac{d^3}{\rho}\big)\sqrt{T}\big) 所界定。这将先前的最佳遗憾保证改善了 O(d/ρ)O(d/\rho) 倍,表明我们的乐观算法能够大幅降低可复制性的代价。

关键词

引用

@article{arxiv.2604.20024,
  title  = {Replicable Bandits with UCB based Exploration},
  author = {Rohan Deb and Udaya Ghai and Karan Singh and Arindam Banerjee},
  journal= {arXiv preprint arXiv:2604.20024},
  year   = {2026}
}