中文

FLEx:通过专家嫁接实现混合专家大型语言模型的个性化联邦学习

人工智能 2025-10-08 v2

摘要

大型语言模型 (LLM) 的联邦指令微调面临着客户端间显著数据异构性的挑战,需要鲁棒的个性化。混合专家 (MoE) 架构(其中专家可以专门处理不同的数据模式)为这一挑战提供了一种自然的架构解决方案。MoE 架构通过选择性激活专家实现的固有稀疏性,对其与联邦学习 (FL) 的集成构成了重大挑战。为稠密模型设计的传统 FL 框架,不考虑局部激活模式而天真地聚合所有专家参数。这种天真的方法不仅破坏了 MoE 的动态稀疏性,还面临破坏预训练专家中世界知识的风险。为了解决这个问题,我们提出了 FLEx(具有个性化专家的联邦 LLM),一种利用预训练基于 MoE 的 LLM 实现高效个性化的新颖框架。通过仅聚合共享的非专家参数,FLEx 显著减少了通信开销,并保留了冻结的预训练专家中存储的世界知识。为了实现个性化,我们引入了一种新颖的专家嫁接机制,该机制利用动态稀疏性从预训练专家的选定组件中构建针对局部数据量身定制的客户端特定专家。然后,该嫁接专家与门控机制一起在局部进行微调。这种联合训练使模型能够学习何时利用来自冻结专家的共享知识,何时使用个性化知识。在多样的非独立同分布指令微调数据集上的评估表明,FLEx 平均而言始终优于联邦基线,同时在知识驱动基准 MMLU 上表现出强大的知识保留能力。我们的代码可在 \href{https://anonymous.4open.science/r/FLEx-8F12}{\texttt{https://anonymous.4open.science/r/FLEx-8F12}} 获取。

关键词

引用

@article{arxiv.2506.00965,
  title  = {FLEx: Personalized Federated Learning for Mixture-of-Experts LLMs via Expert Grafting},
  author = {Fan Liu and Bikang Pan and Zhongyi Wang and Xi Yao and Xiaoying Tang and Jingya Wang and Ye Shi},
  journal= {arXiv preprint arXiv:2506.00965},
  year   = {2025}
}