中文

通过个性化实现公平的联邦数据聚类:弥合数据分布差异的鸿沟

机器学习 2024-07-15 v2

摘要

边缘设备数据的快速增长正在催化机器学习算法的性能。然而,这些数据主要驻留在客户端,因此传统机器学习范式面临两个主要挑战:数据集中训练以及大多数生成数据缺乏类别标签,客户因高成本和缺乏专业知识而对手动标注数据缺乏激励。为克服这些问题,已有初步尝试以隐私保护的方式在分布式环境中处理未标记数据,使用无监督式联邦数据聚类。目标是将客户端上可用的数据划分为k个分区(称为聚类),而无需实际交换数据。大多数现有算法高度依赖跨客户端的数据分布模式,或计算开销很大。此外,由于实际场景中客户端数据呈现偏斜性质,现有模型可能导致客户端承担高额聚类成本,使其不愿参与联邦过程。针对此问题,我们首次引入在联邦聚类中引入个性化的思想。目标是在实现较低聚类成本的同时实现各客户端成本均衡。我们提出了p-FClus,通过服务器与客户端之间的单次通信来实现上述目标。我们在多种联邦数据集上验证了p-FClus的有效性,展示了其数据独立性、适用于任意有限ℓ-范数,同时实现低成本和低方差。

关键词

引用

@article{arxiv.2407.04302,
  title  = {Fair Federated Data Clustering through Personalization: Bridging the Gap between Diverse Data Distributions},
  author = {Shivam Gupta and Tarushi and Tsering Wangzes and Shweta Jain},
  journal= {arXiv preprint arXiv:2407.04302},
  year   = {2024}
}