HAFLQ:异构自适应联邦 LoRA 微调带量化的大语言模型
机器学习
2025-05-19 v2 人工智能
分布式、并行与集群计算
摘要
预训练大语言模型 (LLM) 的联邦微调可实现跨越 diverse 数据集的任务特定适应,同时保持隐私。然而,高计算和内存需求、client 资源异构、带宽限制以及全球聚合效果不佳等挑战阻碍了其效率。为此,我们提出 HAFLQ (Heterogeneous Adaptive Federated Low-Rank Adaptation Fine-tuned LLM with Quantization),一种用于异构环境下高效可扩展联邦微调 LLM 的新框架。为降低内存和计算需求,我们提出基于显著性的自适应 LLM 量化框架,该框架使用显著性指标评估 transformer 块的重要性,并按显著性应用自适应块级量化。为处理异构计算能力,我们提出基于重要性的参数截断和冻结方案。为解决通信瓶颈,我们提出基于重要性的带宽自适应量化方法,该方法根据重要性和带宽限制动态调整参数精度。为提高全局模型聚合效果,我们提出基于自适应秩-1 矩阵级聚合策略,该策略通过仅聚合 client 更新的秩-1 矩阵来防止信息稀释并加速收敛。在文本分类任务上的实验结果表明,HAFLQ 将内存使用降低 31%,通信成本降低 49%,准确率提高 50%,并实现更快的收敛速度。
引用
@article{arxiv.2411.06581,
title = {HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization},
author = {Yang Su and Na Yan and Yansha Deng and Mischa Dohler and Robert Schober},
journal= {arXiv preprint arXiv:2411.06581},
year = {2025}
}
备注
This is an extended journal version based on our previous conference paper accepted at the 2025 IEEE International Conference on Communications (ICC), with additional sections and new results