中文

FedYolo:用预训练 Transformer 增强联邦学习

机器学习 2023-07-12 v1 分布式、并行与集群计算

摘要

机器学习应用的增长与多样化促使我们重新思考利用移动与边缘设备的学习范式。我们如何满足多样的客户端目标并在稀缺异构数据下学习?尽管联邦学习旨在解决这些问题,但其面临的挑战阻碍了统一方案的达成。大型 transformer 模型已被证明可跨多种任务工作并实现卓越的少样本适应。这引出一个问题:客户端能否在遵守设备与网络约束的前提下,使用单一通用模型而非为每项任务定制模型?本工作中,我们研究预训练 transformer(PTF)以实现这些设备端学习目标,并深入探究模型规模与模块化的作用,后者指通过提示或适配器等模块进行适应。聚焦联邦学习,我们证明:(1)更大规模缩小了不同方法间的精度差距并提升异构鲁棒性。规模使客户端能运行更多本地 SGD 轮次,显著减少通信轮数。在极端情况下,客户端可在本地达到可观精度,凸显全本地学习的潜力。(2)模块化在设计上实现了 >100×>100\times 更少的比特通信。令人惊讶的是,它还提升了本地适应方法的泛化能力与较小 PTF 的鲁棒性。最终,它使客户端能用单一 PTF 同时解决多个不相关任务,而全量更新易遭遇灾难性遗忘。这些关于规模与模块化的洞见催生了我们称为“You Only Load Once”(FedYolo)的新联邦学习方法:客户端一次性加载完整 PTF 模型,此后所有更新均通过通信高效的模块完成且灾难性遗忘有限,每项任务分配至其专属模块。

关键词

引用

@article{arxiv.2307.04905,
  title  = {FedYolo: Augmenting Federated Learning with Pretrained Transformers},
  author = {Xuechen Zhang and Mingchen Li and Xiangyu Chang and Jiasi Chen and Amit K. Roy-Chowdhury and Ananda Theertha Suresh and Samet Oymak},
  journal= {arXiv preprint arXiv:2307.04905},
  year   = {2023}
}

备注

20 pages, 18 figures