中文

FRAIN训练法:一种快速可靠的去中心化联邦学习解决方案

机器学习 2025-05-09 v1 人工智能 分布式、并行与集群计算

摘要

联邦学习(FL)能够在保持数据本地化的同时,实现跨分布式客户端的协作模型训练。尽管FedAvg开创了用于全局模型平均的同步轮次,但较慢的设备可能会延迟整体进度。异步联邦学习(例如FedAsync)通过持续整合客户端更新来解决掉队者问题,然而朴素的实现方式可能会因非独立同分布数据和陈旧贡献而导致客户端漂移。一些基于区块链的联邦学习方法(例如BRAIN)采用对更新进行稳健加权或评分来抵抗恶意或错位的提案。然而,在严重的数据异质性或高陈旧度下,性能下降仍可能持续存在,并且由于其无聚合器的架构,同步开销已成为一个新的关注点。我们引入了快速可靠的人工智能网络FRAIN,这是一种新的异步联邦学习方法,通过纳入两个关键思想来缓解这些限制。首先,我们的FastSync策略消除了重放过去模型版本的需要,使新加入者和不频繁的参与者能够高效地逼近全局模型。其次,我们在合并参数时采用球面线性插值(SLERP),以保持模型的方向并减轻来自发散性本地训练的破坏性干扰。使用CNN图像分类模型和基于Transformer的语言模型进行的实验表明,与FedAvg、FedAsync和BRAIN相比,FRAIN实现了更稳定和更鲁棒的收敛,尤其是在恶劣环境下:非独立同分布数据分布、经历延迟并需要频繁重新同步的网络,以及存在恶意节点的情况。

关键词

引用

@article{arxiv.2505.04223,
  title  = {FRAIN to Train: A Fast-and-Reliable Solution for Decentralized Federated Learning},
  author = {Sanghyeon Park and Soo-Mook Moon},
  journal= {arXiv preprint arXiv:2505.04223},
  year   = {2025}
}