使用 Dirichlet-Multinomial 混合模型改进联邦数据集建模
机器学习
2024-06-05 v1 分布式、并行与集群计算
摘要
在实际应用中,使用联邦学习进行训练的速度可比标准集中式训练慢几个数量级。这严重限制了可进行的实验与调参数量,使得在给定任务上获得良好性能备受挑战。可在服务器端使用代理数据运行训练仿真,例如用于超参数调优。这一做法可显著加速训练流程,减少在真实客户端上完成调参的次数。然而,确保这些仿真准确反映真实联邦训练动态具有挑战性。特别是,用于仿真的代理数据常作为单一集中数据集提供,而缺乏划分为离散客户端的划分,若对数据进行粗略划分,可能导致仿真未能良好反映真实联邦训练。在本文中,我们解决了如何将集中数据划分为能反映真实联邦客户端统计异质性的挑战。我们提出一种完全联邦化、理论上得到论证的算法,高效学习真实客户端的分布,并观察到在使用推断分布创建仿真客户端时,服务器端仿真效果得到改善。
引用
@article{arxiv.2406.02416,
title = {Improved Modelling of Federated Datasets using Mixtures-of-Dirichlet-Multinomials},
author = {Jonathan Scott and Áine Cahill},
journal= {arXiv preprint arXiv:2406.02416},
year = {2024}
}