Bandit 之上的对抗 Bandit:用于在线配置管理的层次化 Bandit
机器学习
2025-05-27 v1 多智能体系统
机器学习
摘要
受有限但大规模动作(配置)空间中的动态参数优化问题启发,本文研究了在度量动作空间中具有遗忘型 Lipschitz 对手的非随机多臂赌博机(MAB)问题。我们提出了 ABoB,一种层次化的 Bandit 之上的对抗 Bandit 算法,该算法可以使用现有的最先进“扁平”算法,同时额外对相似配置进行聚类,以利用局部结构并适应不断变化的环境。我们证明,在最坏情况下,这种聚类方法不会造成太大损害,ABoB 保证了 的标准最坏情况遗憾界,其中 是轮数, 是臂数,与传统扁平方法相匹配。然而,在与算法性质、聚类性质和特定 Lipschitz 条件相关的有利条件下,遗憾界可以改进为 。在真实存储系统上的仿真和实验表明,使用 EXP3 和 Tsallis-INF 等标准算法的 ABoB 比扁平方法实现了更低的遗憾和更快的收敛速度,在已知的先前设置(非随机和随机)以及我们的设置中改进高达 50%。
引用
@article{arxiv.2505.19061,
title = {Adversarial Bandit over Bandits: Hierarchical Bandits for Online Configuration Management},
author = {Chen Avin and Zvi Lotker and Shie Mannor and Gil Shabat and Hanan Shteingart and Roey Yadgar},
journal= {arXiv preprint arXiv:2505.19061},
year = {2025}
}