中文

HFedMoE: 资源感知的异构化联邦学习基于混合专家模型

机器学习 2026-01-05 v1 人工智能 网络与互联网体系结构

摘要

虽然联邦学习(FL)能够在不损害数据隐私的前提下对大型语言模型(LLM)进行精细调优,但LLM的巨大规模使得在资源受限的客户端(如移动设备)上进行本地训练变得不可行。因此,混合专家模型(Mixture-of-Experts, MoE)作为一种计算效率解决方案涌现出来,在模型训练期间仅激活稀疏的专家子集,以减少计算负担而不牺牲性能。尽管将MoE集成到FL调优中具有重要潜力,但仍面临三个关键挑战:i)由于缺乏可靠的度量标准来衡量每个专家对本地调优性能的影响,选择合适的专家仍然具有挑战性;ii)跨客户端的异构计算资源严重阻碍了基于MoE的LLM调优,因为动态的专家激活在来自不同输入样本的多样化激活中会压倒资源受限的设备;iii)客户端特定的专家子集和路由偏好削弱了全局聚合,其中不对齐的专家更新和不一致的门控网络引入了破坏性干扰。为解决这些挑战,我们提出了HFedMoE——一种基于异构MoE的联邦学习调优框架,该框架为每个客户端定制一部分专家,以实现计算效率的LLM调优。具体而言,HFedMoE基于其对调优性能贡献来识别专家重要性,然后从信息瓶颈角度出发,自适应地从中选择一部分专家以匹配每个客户端的计算预算。还设计了一种稀疏感知的模型聚合策略,用于以重要性加权方式聚合活跃调优的专家和门控参数。大量实验表明,HFedMoE在训练准确率和收敛速度方面均优于最新的基准方法。

关键词

引用

@article{arxiv.2601.00583,
  title  = {HFedMoE: Resource-aware Heterogeneous Federated Learning with Mixture-of-Experts},
  author = {Zihan Fang and Zheng Lin and Senkang Hu and Yanan Ma and Yihang Tao and Yiqin Deng and Xianhao Chen and Yuguang Fang},
  journal= {arXiv preprint arXiv:2601.00583},
  year   = {2026}
}

备注

14 pages, 16 figures