资源受限设备上稀疏激活大语言模型的联邦微调
分布式、并行与集群计算
2025-10-13 v2 人工智能
摘要
由于巨大的计算需求以及参与者的资源限制,基于混合专家的稀疏激活大语言模型的联邦微调极具挑战。现有工作试图通过模型量化、计算卸载或专家剪枝来填补这一空白。然而,由于不切实际的系统假设以及缺乏对 MoE 特定特征的考虑,它们无法达到预期的性能。在本文中,我们提出了 FLUX,这是一个旨在跨计算资源受限的参与者(例如消费级 GPU)实现基于 MoE 的 LLM 联邦微调的系统,旨在最小化达到目标精度的时间。FLUX 引入了三项关键创新:(1)基于量化的本地分析,以最小的开销估计专家激活;(2)自适应的层感知专家合并,在保持准确性的同时减少资源消耗;(3)使用探索-利用策略的动态专家角色分配,以平衡微调与非微调专家。在 LLaMA-MoE 和 DeepSeek-MoE 上结合多个基准数据集的大量实验表明,FLUX 显著优于现有方法,在达到目标精度的时间上实现了高达 4.75 倍的加速。
引用
@article{arxiv.2508.19078,
title = {Federated Fine-Tuning of Sparsely-Activated Large Language Models on Resource-Constrained Devices},
author = {Fahao Chen and Jie Wan and Peng Li and Zhou Su and Dongxiao Yu},
journal= {arXiv preprint arXiv:2508.19078},
year = {2025}
}
备注
Accepted by EuroSys 2026