联邦在线聚类_bandits
机器学习
2022-09-01 v1
摘要
上下文多臂_bandit(MAB)是推荐系统中一类重要的序贯决策问题。一系列被称为聚类_bandits(CLUB)的工作利用用户间的协作效应,显著提升了推荐质量。随着应用规模扩大与公众对隐私的关注增长,将用户数据去中心化并将_bandit学习推至本地服务器端的需求日益增加。然而,现有 CLUB 算法均设计于数据集中于中心服务器的集中式设定下。我们聚焦于联邦在线聚类_bandit(FCLUB)问题,旨在满足隐私与通信约束的同时最小化总后悔值。我们为该问题设计了一种基于新阶段划分的簇检测方案,以及一种用于协作_bandit学习的新型异步通信协议。为保护用户隐私,此前的差分隐私(DP)定义并不十分适用,我们提出了一种作用于用户簇级别的新 DP 概念。我们给出严格证明,表明我们的算法同时实现了(聚类)DP、亚线性通信复杂度与亚线性后悔值。最后,实验评估显示我们相较基准算法具有更优性能。
引用
@article{arxiv.2208.14865,
title = {Federated Online Clustering of Bandits},
author = {Xutong Liu and Haoru Zhao and Tong Yu and Shuai Li and John C. S. Lui},
journal= {arXiv preprint arXiv:2208.14865},
year = {2022}
}