联邦线性上下文_bandits
机器学习
2021-10-28 v1 信息论
机器学习
math.IT
摘要
本文提出一种新颖的联邦线性上下文_bandits 模型,其中各客户端面对不同的 -臂随机_bandits,并通过共同的全局参数相耦合。通过利用线性奖励的几何结构,提出一种称为 Fed-PE 的协作算法,以在不交换本地特征向量或原始数据的情况下应对客户端间的异质性。Fed-PE 依赖于一种新颖的多客户端 G-最优设计,并以对数通信代价在分离参数与共享参数两种情形下均达到近最优后悔界。此外,引入了一种称为共线依赖策略的新概念,并基于此推导了分离参数情形下的紧极小极大后悔下界。实验在合成与真实数据集上均展示了所提算法的有效性。
引用
@article{arxiv.2110.14177,
title = {Federated Linear Contextual Bandits},
author = {Ruiquan Huang and Weiqiang Wu and Jing Yang and Cong Shen},
journal= {arXiv preprint arXiv:2110.14177},
year = {2021}
}