面向对抗性损坏的近最优、可扩展且可并行化的随机多臂老虎机框架
机器学习
2026-01-05 v2
摘要
我们研究了在对抗性损坏存在的情况下的各种随机多臂老虎机问题。该问题的一个关键工作是BARBAR~\cite{gupta2019better}算法,它实现了鲁棒性和效率,但其拥有的 regret,无法匹配下界,其中K表示臂数,C表示损坏程度。在本文中,我们首先通过提出一种新型框架称为BARBAT来改进BARBAR算法,以消除K的因子,实现近最优的 regret 上界。我们还将BARBAT扩展到 various 设置,包括多智能体老虎机、图形老虎机、组合半老虎机和批量老虎机。与Follow-the-Regularized-Leader框架相比,我们的方法更适合并行化,适用于多智能体和批量老虎机设置,并且在半老虎机问题中计算成本更低。数值实验验证了所提方法的有效性。
引用
@article{arxiv.2502.07514,
title = {A Near-optimal, Scalable and Parallelizable Framework for Stochastic Bandits Robust to Adversarial Corruptions and Beyond},
author = {Zicheng Hu and Cheng Chen},
journal= {arXiv preprint arXiv:2502.07514},
year = {2026}
}
备注
Accepted at NeurIPS 2025