基于层丢弃的高效联邦大语言模型精调
机器学习
2025-03-14 v1 人工智能
分布式、并行与集群计算
摘要
精调在使预训练大语言模型从通用语言理解发展为任务特定专长方面起到了关键作用。为保护用户隐私,常采用联邦精调,已成为事实上的范式。然而,由于大语言模型的复杂性与终端设备资源限制之间的矛盾,联邦精调效率极低,造成不可接受的精调开销。现有文献主要利用参数高效精调技术来缓解通信成本,然而计算和内存负担仍然是开发人员面临的重大挑战。本工作提出了 DropPEFT,这是一种创新的联邦 PEFT 框架,采用新颖的随机 Transformer 层丢弃方法,使设备能够在训练期间停用大量大语言模型层,从而消除其计算负载和内存占用。在 DropPEFT 中,一个关键挑战是正确配置各层的丢弃比率,因为开销和训练性能对该设置极其敏感。为解决这一挑战,我们通过探索-开发策略对设备自适应分配最优丢弃比率配置,实现高效且有效的精调。大量实验表明,DropPEFT 在模型收敛速度上可实现 1.3-6.3 倍加速,内存占用相较于最先进方法降低 40%-67%。
引用
@article{arxiv.2503.10217,
title = {Efficient Federated Fine-Tuning of Large Language Models with Layer Dropout},
author = {Shilong Wang and Jianchun Liu and Hongli Xu and Jiaming Yan and Xianjun Gao},
journal= {arXiv preprint arXiv:2503.10217},
year = {2025}
}
备注
13 pages