LoRA 启用分布式微调中聚合-广播收敛性分析
机器学习
2025-09-03 v2 人工智能
摘要
联邦学习(FL)使跨去中心化数据源的协作模型训练成为可能,同时保持数据隐私。然而,机器学习(ML)模型规模的不断增长在 FL 中带来了通信和计算挑战。低秩适应(LoRA)最近被引入 FL 作为一种高效微调方法,通过仅更新少数可训练参数来降低通信开销。尽管其有效性已获证实,但如何对 LoRA 更新的本地模型进行服务器端聚合仍是一个关键且鲜有研究的问题。本文提供了 LoRA 基于 FL 的统一收敛分析。我们首先将当前的聚合方法分为两大类型:乘积求和(SP)和求和乘积(PS)。随后,我们正式定义聚合-广播算子(ABO),并在轻度假设下推导出两者的弱收敛和强收敛条件。此外,我们提出了保证局部模型和全局模型分别收敛的弱收敛和强收敛条件。这些理论分析提供了对各种聚合策略的原则性理解。值得注意的是,我们证明了 SP 和 PS 聚合方法分别满足弱收敛和强收敛条件,但在实现最优收敛速率方面存在差异。大量实验在标准基准数据集上验证了我们的理论发现。
引用
@article{arxiv.2508.01348,
title = {Convergence Analysis of Aggregation-Broadcast in LoRA-enabled Distributed Fine-Tuning},
author = {Xin Chen and Shuaijun Chen and Omid Tavallaie and Nguyen Tran and Shuhuang Xiang and Albert Zomaya},
journal= {arXiv preprint arXiv:2508.01348},
year = {2025}
}