完全去中心化神经网络系统中的方差消失问题
机器学习
2024-06-19 v2 分布式、并行与集群计算
摘要
联邦学习与流言学习是旨在通过将训练数据保留在客户端设备上,且仅共享本地训练的机器学习(ML)模型来缓解数据隐私问题的新兴方法。两者的主要区别在于模型聚合方式:联邦学习采用中心化参数服务器,而流言学习采用完全去中心化机制,实现节点间的直接模型交换。这种去中心化特性通常使得流言学习的效率低于联邦学习。两种方法均涉及一个关键步骤:计算接收到的 ML 模型的表示,并将该表示整合到现有模型中。通常,该表示通过对收到的模型求平均得到,FedAVG 算法即是一例。我们的研究表明,这种平均方法本质上会引入模型收敛的潜在延迟。我们识别了其根本原因并将其称为“方差消失”问题,即对不相关的 ML 模型求平均会破坏由 Xavier 权重初始化所建立的最优方差。不同于联邦学习中由中央服务器确保模型相关性,也不同于传统流言学习通过模型划分与采样来规避此问题,我们的研究引入了一种方差修正的模型平均算法。这种新型算法在模型平均过程中保留了所需的最优方差,且不受网络拓扑或非独立同分布数据的影响。我们广泛的仿真结果表明,该方法使流言学习能够实现与联邦学习相当的收敛效率。
引用
@article{arxiv.2404.04616,
title = {Vanishing Variance Problem in Fully Decentralized Neural-Network Systems},
author = {Yongding Tian and Zaid Al-Ars and Maksim Kitsak and Peter Hofstee},
journal= {arXiv preprint arXiv:2404.04616},
year = {2024}
}
备注
7 pages