具有有限对抗动作集的联邦线性_bandits
机器学习
2023-11-03 v1 信息论
math.IT
机器学习
摘要
我们研究了一种联邦线性 bandits 模型,其中 个客户端与中央服务器通信,以求解具有有限对抗动作集的线性上下文 bandits 问题,且各客户端的动作集可能不同。为应对对抗性有限动作集带来的独特挑战,我们提出了 FedSupLinUCB 算法,其扩展了线性上下文 bandits 中 SupLinUCB 与 OFUL 算法的原理。我们证明 FedSupLinUCB 实现了 的总后悔界,其中 为所有客户端的总拉臂次数, 为线性模型的 ambient 维数。该界与极小极大下界匹配,因而是最优阶的(至多相差多对数项)。我们研究了异步与同步两种情况,并表明通信代价可分别控制为 与 。FedSupLinUCB 的设计进一步扩展到两种场景:(1)方差自适应,可实现 的总后悔界,其中 为第 轮噪声方差;(2)对抗污染,可实现 的总后悔界,其中 为总污染预算。实验结果佐证了理论分析,并证明了 FedSupLinUCB 在合成与真实世界数据集上的有效性。
引用
@article{arxiv.2311.00973,
title = {Federated Linear Bandits with Finite Adversarial Actions},
author = {Li Fan and Ruida Zhou and Chao Tian and Cong Shen},
journal= {arXiv preprint arXiv:2311.00973},
year = {2023}
}
备注
Accepted to NeurIPS 2023, camera-ready version