中文

具有有限对抗动作集的联邦线性_bandits

机器学习 2023-11-03 v1 信息论 math.IT 机器学习

摘要

我们研究了一种联邦线性 bandits 模型,其中 MM 个客户端与中央服务器通信,以求解具有有限对抗动作集的线性上下文 bandits 问题,且各客户端的动作集可能不同。为应对对抗性有限动作集带来的独特挑战,我们提出了 FedSupLinUCB 算法,其扩展了线性上下文 bandits 中 SupLinUCB 与 OFUL 算法的原理。我们证明 FedSupLinUCB 实现了 O~(dT)\tilde{O}(\sqrt{d T}) 的总后悔界,其中 TT 为所有客户端的总拉臂次数,dd 为线性模型的 ambient 维数。该界与极小极大下界匹配,因而是最优阶的(至多相差多对数项)。我们研究了异步与同步两种情况,并表明通信代价可分别控制为 O(dM2log(d)log(T))O(d M^2 \log(d)\log(T))O(d3M3log(d))O(\sqrt{d^3 M^3} \log(d))。FedSupLinUCB 的设计进一步扩展到两种场景:(1)方差自适应,可实现 O~(dt=1Tσt2)\tilde{O} (\sqrt{d \sum \nolimits_{t=1}^{T} \sigma_t^2}) 的总后悔界,其中 σt2\sigma_t^2 为第 tt 轮噪声方差;(2)对抗污染,可实现 O~(dT+dCp)\tilde{O}(\sqrt{dT} + d C_p) 的总后悔界,其中 CpC_p 为总污染预算。实验结果佐证了理论分析,并证明了 FedSupLinUCB 在合成与真实世界数据集上的有效性。

关键词

引用

@article{arxiv.2311.00973,
  title  = {Federated Linear Bandits with Finite Adversarial Actions},
  author = {Li Fan and Ruida Zhou and Chao Tian and Cong Shen},
  journal= {arXiv preprint arXiv:2311.00973},
  year   = {2023}
}

备注

Accepted to NeurIPS 2023, camera-ready version