中文

联邦动态稀疏训练:计算更少、通信更少,却学得更好

机器学习 2021-12-21 v1 人工智能 机器学习

摘要

联邦学习(FL)将机器学习工作负载从云端分发到资源受限的边缘设备。遗憾的是,当前的深度网络不仅计算负担过重以至于难以在边缘设备上推理和训练,而且模型过大以至于难以在带宽受限的网络上传输更新。本文中,我们开发、实现并实验验证了一种称为联邦动态稀疏训练(FedDST)的新型 FL 框架,借助该框架,复杂神经网络可以以显著改善的效率在设备端计算与网络内通信两方面被部署和训练。FedDST 的核心是一个从目标完整网络中提取并训练稀疏子网络动态过程。借助该方案,“一石二鸟”:每个客户端不再训练完整模型,而是高效训练其自身的稀疏网络,且仅有稀疏网络在设备与云之间传输。此外,我们的结果表明,FL 训练期间的动态稀疏性比固定的共享稀疏掩码更灵活地适应了 FL 智能体中的局部异质性。而且,动态稀疏性自然地将一种“即时自集成效应”引入训练动态,并比稠密训练提升了 FL 性能。在一个真实且具挑战性的非 i.i.d. FL 设定中,FedDST 在我们的实验中持续优于对比算法:例如,在非 i.i.d. CIFAR-10 上任意固定的上传数据上限下,给定相同上传数据上限时,它相比 FedAvgM 获得了 10% 的显著准确率优势;即便 FedAvgM 给定 2 倍上传数据上限,准确率差距仍保持 3%,进一步证明了 FedDST 的功效。代码见:https://github.com/bibikar/feddst。

关键词

引用

@article{arxiv.2112.09824,
  title  = {Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better},
  author = {Sameer Bibikar and Haris Vikalo and Zhangyang Wang and Xiaohan Chen},
  journal= {arXiv preprint arXiv:2112.09824},
  year   = {2021}
}