FeDeRA:基于权重分解在联邦学习中高效微调语言模型
机器学习
2024-05-28 v3 人工智能
计算与语言
摘要
尽管经过微调后在各种任务上表现卓越,但预训练语言模型(PLMs)面临着由于数据集中训练方法引发的隐私问题带来的重大挑战。我们考虑在本文中将联邦学习(FL)用于微调 PLMs。然而,PLMs 参数数量庞大,对资源有限的客户端设备造成了显著的计算和通信资源挑战。一个有前景的解决方案是将参数高效微调(PEFT)引入 FL,这种方法比完整参数微调(FFT)训练更小的参数集合。尽管显著提高了训练效率,但 PEFT 方法在数据跨不同客户端非独立同分布(non i.i.d)时可能导致性能下降,如实验结果所示。为此,我们提出了 FeDeRA,通过对 PLMs 的权重矩阵进行奇异值分解(SVD)来初始化低秩矩阵,从而扩展并改进了广泛使用的 PEFT 方法,即低秩适配(LoRA)。FeDeRA 遵循 LoRA 的做法,将 PLMs 的权力矩阵分解为低秩矩阵,这允许在微调期间进行更高效的计算和参数更新。广泛的实验在各种任务和数据集上表明,FeDeRA 在 FL 环境下优于所考虑的 PEFT 基线方法,甚至在任务性能上与 FFT 方法相当或更好。此外,FeDeRA 只需 1% 的可训练参数即可完成微调,将训练时间成本缩短超过 90%。实验结果还突显了 FeDeRA 对数据异构性的鲁棒性,即使数据异构性增加,FeDeRA 也能保持稳定的任务性能。
引用
@article{arxiv.2404.18848,
title = {FeDeRA:Efficient Fine-tuning of Language Models in Federated Learning Leveraging Weight Decomposition},
author = {Yuxuan Yan and Qianqian Yang and Shunpu Tang and Zhiguo Shi},
journal= {arXiv preprint arXiv:2404.18848},
year = {2024}
}