中文

HeteroTune:大规模异构模型的高效联邦学习

机器学习 2025-08-26 v2 计算与语言 计算机视觉与模式识别 分布式、并行与集群计算

摘要

虽然大型预训练模型在 AI 任务中取得了令人瞩目的性能,但其在隐私敏感和分布式环境中的部署仍面临挑战。联邦学习(FL)通过启用无需数据共享的去中心化微调,提供了可行的解决方案,但实际应用面临由于客户端计算和内存资源的异构性导致的显著障碍。为此,我们提出了 HeteroTune,这是一种用于大规模异构模型的 novel 联邦微调范式,在有限的通信和计算预算下运行。我们的方法的核心在于一种 novel 架构,DeMA(Dense Mixture of Adapters),它通过保持其完整表示能力的同时,促进异构模型之间无缝的跨模型知识融合。我们进一步引入了 CMGA(Cross-Model Gradient Alignment),这是一种轻量且有效的机制,通过在聚合过程中整合跨异构客户端模型的梯度方向,以增强训练稳定性,减轻更新冲突,促进联邦环境中更一致的收敛。我们提供了理论分析和实证证据,表明 HeteroTune 在 diverse 任务和模型架构上实现了最先进的性能和效率。例如,在 LLaMA 模型上,它将通信开销降低 99.5%,将峰值内存使用降低约 50%,并提升性能 4.61%。

关键词

引用

@article{arxiv.2411.16796,
  title  = {HeteroTune: Efficient Federated Learning for Large Heterogeneous Models},
  author = {Ruofan Jia and Weiying Xie and Jie Lei and Jitao Ma and Haonan Qin and Leyuan Fang},
  journal= {arXiv preprint arXiv:2411.16796},
  year   = {2025}
}

备注

16 pages, 4 figures