中文

全部保存:通过循环块梯度下降实现联邦大语言模型的完全参数微调

机器学习 2024-07-22 v2

摘要

大语言模型(LLM)的出现彻底改变了深度学习范式,在广泛的任务中取得了令人瞩目的成果。然而,在联邦学习(FL)框架内对LLM进行预训练或微调带来了巨大的挑战,包括大量的计算和内存资源需求,以及服务器与客户端之间的通信瓶颈。现有的解决方案要么做出不切实际的假设,即需要交换整个模型进行训练,要么应用集中式学习中的参数高效微调方法来训练FL中的LLM,这些方法往往在训练或微调阶段表现不佳,因为其参数更新搜索空间有限。在本文中,我们介绍了一种在FL中高效训练和微调LLM的新方法,且资源需求极低。我们的方法称为FedCyBGD,利用循环块梯度下降定期更新模型。我们为FedCyBGD设计了一种压缩方案,旨在进一步降低模型下载成本。它使得在FL中仅通过更新和上传部分块即可实现全参数训练,从而减少了通信、计算和内存开销。我们的方法在FL LLM训练中取得了最先进的性能,同时显著降低了相关成本。文中提供了代码。

关键词

引用

@article{arxiv.2406.11187,
  title  = {Save It All: Enabling Full Parameter Tuning for Federated Large Language Models via Cycle Block Gradient Descent},
  author = {Lin Wang and Zhichao Wang and Xiaoying Tang},
  journal= {arXiv preprint arXiv:2406.11187},
  year   = {2024}
}