基于数据异构性的混合专家联邦学习中的聚合对齐
机器学习
2026-03-24 v1 人工智能
摘要
大型语言模型 (LLM) 越来越多地采用混合专家 (MoE) 架构,以在扩大模型容量的同时降低计算开销。对这些基于 MoE 的 LLM 进行微调通常需要访问分布式且隐私敏感的数据,这使得集中式微调变得不实用。因此,联邦学习 (FL) 提供了一种通过协同微调 MoE-based LLM 的范式,使每个客户整合多样化的知识而不泄露数据隐私。然而,将 MoE-based LLM 微调集成到 FL 中面临两个关键聚合挑战,源于客户之间固有的异构性数据:(i) 各客户的数据分布差异导致它们发展出不同的门控偏好,从而选择特定的专家,直接的参数聚合会产生一个“尺寸适用但无效”的全局门控网络;(ii) 相同索引的专家在不同客户之间承担不同的语义角色,导致专家语义模糊化,进而损害专家的专业化。为解决这些挑战,我们提出了 FedAlign-MoE,一种联邦聚合对齐框架,联合实现路由一致性和专家语义对齐。具体而言,FedAlign-MoE 通过一致性加权对齐路由分布来聚合门控行为,并通过分布正则化优化本地门控网络,维持跨客户的稳定性而不覆盖判别性的本地偏好。与此同时,FedAlign-MoE 明确量化同一索引专家在不同客户之间的语义一致性,并从语义对齐的客户中选择性地聚合更新,确保全局专家具有稳定且专业化的功能角色。大量实验表明,FedAlign-MoE 在非 IID 联邦环境下优于当前最先进的基准,实现更快的收敛并表现出更优的准确率。
引用
@article{arxiv.2603.21276,
title = {Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity},
author = {Zihan Fang and Qianru Wang and Haonan An and Zheng Lin and Yiqin Deng and Xianhao Chen and Yuguang Fang},
journal= {arXiv preprint arXiv:2603.21276},
year = {2026}
}
备注
14 pages, 14 figures