中文

大语言模型零阶联邦微调的收敛性

机器学习 2024-06-18 v3 计算与语言

摘要

联邦学习(FL)与大语言模型(LLM)的融合正在开启隐私保护自然语言处理的新时代。然而,微调 LLM 对内存的密集需求带来了重大挑战,尤其是在计算资源有限的客户端上进行部署时。为了规避这一问题,我们探索了在联邦环境中整合内存高效的零阶优化(Memory-efficient Zeroth-Order Optimization),这种协同作用我们称之为 FedMeZO。我们的研究首次检验了 FedMeZO 在 LLM 背景下的理论基础,解决了关于大参数空间对优化行为的影响、收敛性的建立以及确定收敛的关键参数以指导个性化联邦策略等关键问题。我们广泛的实验证据支持了该理论,表明 FedMeZO 不仅比 FedAvg 等传统一阶方法收敛更快,而且在训练期间显著减少了 GPU 内存使用,降至与推理期间相当的水平。此外,基于理论见解提出的、用于定制各客户端学习率的个性化联邦学习策略,能够有效加速损失的降低。我们希望我们的工作能够帮助弥合 LLM 联邦微调的理论与实践之间的差距,从而激发该领域的进一步进步和研究。

关键词

引用

@article{arxiv.2402.05926,
  title  = {On the Convergence of Zeroth-Order Federated Tuning for Large Language Models},
  author = {Zhenqing Ling and Daoyuan Chen and Liuyi Yao and Yaliang Li and Ying Shen},
  journal= {arXiv preprint arXiv:2402.05926},
  year   = {2024}
}

备注

accepted by KDD'24 research track. 21 pages, 10 figures, 8 tables