中文

分布式数据源上机器学习模型的训练代价

机器学习 2023-03-01 v2

摘要

联邦学习是标准集中式学习范式中最具吸引力的替代方案之一,它允许一组异构设备在不共享原始数据的情况下训练机器学习模型。然而,它需要中央服务器来协调学习过程,从而引入了潜在的可扩展性与安全性问题。文献中已提出无服务器联邦学习方法,如 gossip 联邦学习和区块链赋能的联邦学习,以缓解这些问题。在本工作中,我们对这三种技术进行了完整综述,并依据一组综合性能指标进行比较,包括模型精度、时间复杂度、通信开销、收敛时间和能耗。一项广泛的仿真活动考虑前馈神经网络和卷积神经网络模型,从而得出定量分析。结果表明,gossip 联邦学习与标准联邦方案能够达到相似的精度水平,且其能耗受所采用的机器学习模型、软件库及所用硬件的影响。不同的是,区块链赋能的联邦学习代表了以更高能耗和数据共享为代价来实现具有更高安全性水平去中心化学习的可行方案。最后,我们指出了两种去中心化联邦学习实现中的开放问题,并就该新兴研究领域的潜在扩展与可能的研究方向提供见解。

关键词

引用

@article{arxiv.2209.07124,
  title  = {The Cost of Training Machine Learning Models over Distributed Data Sources},
  author = {Elia Guerra and Francesc Wilhelmi and Marco Miozzo and Paolo Dini},
  journal= {arXiv preprint arXiv:2209.07124},
  year   = {2023}
}