通过联邦混合专家实现大规模 AI 模型的高效训练:一种系统级方法
机器学习
2025-07-09 v1 人工智能
摘要
联邦学习(FL)与混合专家(MoE)的融合,为在保护隐私的前提下基于去中心化数据训练更强大的大规模人工智能模型(LAMs)提供了一条极具吸引力的路径。然而,这些复杂 MoE 结构 LAMs 的高效联邦训练面临显著的系统级挑战,尤其体现在管理异构客户端资源与众多专用专家之间所需的精细协调方面。本文着重指出一个关键但尚未充分探索的概念:目前缺乏稳健的定量策略来实现动态的客户端-专家对齐,以整体兼顾不同的客户端能力与系统级负载均衡的迫切需求。具体而言,我们提出了一种智能客户端-专家对齐的概念性系统设计,融合了动态适应度评分、全局专家负载监控以及客户端能力画像。通过应对这些系统性问题,我们能够解锁更具可扩展性、高效性与鲁棒性的训练机制,以更少的通信轮次实现收敛,从而为在边缘计算场景中以超高通信效率广泛部署大规模联邦 MoE 结构 LAMs 铺平道路。
引用
@article{arxiv.2507.05685,
title = {Efficient Training of Large-Scale AI Models Through Federated Mixture-of-Experts: A System-Level Approach},
author = {Xiaobing Chen and Boyang Zhang and Xiangwei Zhou and Mingxuan Sun and Shuai Zhang and Songyang Zhang and Geoffrey Ye Li},
journal= {arXiv preprint arXiv:2507.05685},
year = {2025}
}
备注
7 pages