FFT-MoE:基于大规模稀疏MoE的高效联邦微调框架用于异构边缘设备
机器学习
2025-08-27 v1 人工智能
摘要
随着FM推动人工通用智能(AGI)的进步,对受隐私和资源约束限制下的微调变得越来越关键,尤其是当高质量训练数据驻留在分布式边缘设备上时。联邦学习(FL)通过联邦微调(FFT)提供了 compelling解决方案,通过联邦微调可以在不共享原始数据的情况下实现协作模型适应。最近的做法采用参数高效微调(PEFT)技术,如低秩适应(LoRA),以减少计算开销。然而,LoRA-based FFT在异构FL环境中面临两个主要限制:跨客户端之间结构不兼容,由于LoRA配置的差异,以及对非独立同分布(i.i.d)数据分布的适应性有限,这会阻碍收敛和泛化。为此,我们提出了FFT MoE,一种新的FFT框架将LoRA替换为稀疏混合专家(MoE)适配器。每个客户端训练一个轻量级门控网络,以选择性地激活个人化的专家子集,实现对本地资源预算的细粒度适应,同时保持聚合兼容性。为进一步 combat由于设备和数据异构性导致的专家负载不平衡,我们引入一种异构性感知辅助损失,动态正则化路由分布以确保专家多样性和平衡利用。在覆盖i.i.d和非i.i.d条件的广泛实验中,FFT MoE在泛化性能和训练效率方面 consistently 优于最先进的FFT基线方法。
引用
@article{arxiv.2508.18663,
title = {FFT-MoE: Efficient Federated Fine-Tuning for Foundation Models via Large-scale Sparse MoE under Heterogeneous Edge},
author = {Gang Hu and Yinglei Teng and Pengfei Wu and Nan Wang},
journal= {arXiv preprint arXiv:2508.18663},
year = {2025}
}
备注
9 pages, 6 figures