中文

探索梯度子空间:解决并克服LoRA在大语言模型联邦微调中的局限性

机器学习 2025-01-15 v6 人工智能

摘要

大语言模型(LLMs)在各个领域展现了卓越的能力,特别是在文本和视觉数据的任务泛化方面。虽然微调这些模型可以显著提升其在特定下游任务上的性能,但这通常需要无法因隐私问题而共享的高质量数据。联邦学习(FL)为无需直接数据共享的协作训练提供了有前景的解决方案。然而,许多针对联邦学习中LLMs的参数高效微调策略,特别是基于低秩适应(LoRA)的方法,面临局限性。在本文中,我们批判性地分析了利用LoRA的流行FL框架的收敛性与性能保证,指出其由于低秩矩阵的受限子空间学习而表现次优。这一局限性阻碍了联邦设置中LLMs的有效微调。通过严格的分析与实证评估,我们证明直接权重平均优于基于LoRA的策略,为微调模型带来更优性能。我们的全面比较揭示了LoRA方法中的低效性,并强调了直接权重聚合的优势。我们将分析扩展至局部训练步骤中使用的低秩梯度优化器,如 GaLore。我们的结果表明,GaLore 结合直接权重聚合是一种更有效的方法,在文本和图像两种模态上均优于联邦LoRA方法如 FlexLoRA 和 FFA-LoRA。虽然隐私在FL讨论中至关重要,但我们的重点在于评估联邦微调模型的性能结果,并从理论和实证两个角度评估各种FL框架。我们的发现倡导重新审视在FL语境中对LoRA的依赖,为更高效的训练方法铺平道路。

关键词

引用

@article{arxiv.2410.23111,
  title  = {Exploring Gradient Subspaces: Addressing and Overcoming LoRA's Limitations in Federated Fine-Tuning of Large Language Models},
  author = {Navyansh Mahla and Kshitij Sharad Jadhav and Ganesh Ramakrishnan},
  journal= {arXiv preprint arXiv:2410.23111},
  year   = {2025}
}