基于 UCB 探索的可复制 Bandit 算法
机器学习
2026-04-23 v1
摘要
我们研究了基于 UCB(Upper Confidence Bound,置信上界)探索的随机多臂 Bandit(MAB)与线性 Bandit 的可复制算法。如果两次执行共享内部随机性但奖励实现相互独立,且以至少 的概率产生相同的动作序列,则称该 Bandit 算法是 -可复制的。先前的工作主要基于淘汰策略,且在具有无限多动作的线性 Bandit 中依赖于离散化,导致对维度 和 的依赖关系是次优的。我们为这两种设定开发了乐观替代方案。对于随机多臂 Bandit,我们提出了 RepUCB,一种可复制的批量 UCB 算法,并证明其遗憾为 。对于随机线性 Bandit,我们首先引入了 RepRidge,一种可复制的岭回归估计器,同时满足置信度保证和 -可复制性保证。除了在我们的 Bandit 算法中发挥作用外,该估计器及其保证在其他统计估计设定中也可能具有独立的意义。随后,我们利用 RepRidge 设计了 RepLinUCB,一种用于随机线性 Bandit 的可复制乐观算法,并证明其遗憾被 所界定。这将先前的最佳遗憾保证改善了 倍,表明我们的乐观算法能够大幅降低可复制性的代价。
引用
@article{arxiv.2604.20024,
title = {Replicable Bandits with UCB based Exploration},
author = {Rohan Deb and Udaya Ghai and Karan Singh and Arindam Banerjee},
journal= {arXiv preprint arXiv:2604.20024},
year = {2026}
}