ParaBlock:大型语言模型的通信-计算并行块坐标联邦学习
机器学习
2025-11-26 v1 分布式、并行与集群计算
摘要
联邦学习 (FL) 作为一种隐私保护的训练范式已得到广泛研究。最近,联邦块坐标下降方案因允许客户端仅在局部训练模型的子集而非整个模型而变得非常受欢迎。然而,在大型语言模型 (LLM) 时代,即使单个块也可能包含大量参数,这对资源受限的客户端造成了巨大的通信延迟。为应对这一在 LLM 联邦训练/微调中所面临的挑战,我们提出了 ParaBlock,一种一种建立通信和计算两个平行线程以提高通信效率的新方法。我们理论上证明,所提出的 ParaBlock 达到与标准联邦块坐标下降方法相同的收敛速率。在对 LLM 在通用指令遵循和数学推理上的微调进行经验评估后,结果表明 ParaBlock 不仅保持了强大的性能,还显著提高了通信效率。
引用
@article{arxiv.2511.19959,
title = {ParaBlock: Communication-Computation Parallel Block Coordinate Federated Learning for Large Language Models},
author = {Yujia Wang and Yuanpu Cao and Jinghui Chen},
journal= {arXiv preprint arXiv:2511.19959},
year = {2025}
}
备注
32 pages, 2 figures