中文

HAFLQ:异构自适应联邦 LoRA 微调带量化的大语言模型

机器学习 2025-05-19 v2 人工智能 分布式、并行与集群计算

摘要

预训练大语言模型 (LLM) 的联邦微调可实现跨越 diverse 数据集的任务特定适应,同时保持隐私。然而,高计算和内存需求、client 资源异构、带宽限制以及全球聚合效果不佳等挑战阻碍了其效率。为此,我们提出 HAFLQ (Heterogeneous Adaptive Federated Low-Rank Adaptation Fine-tuned LLM with Quantization),一种用于异构环境下高效可扩展联邦微调 LLM 的新框架。为降低内存和计算需求,我们提出基于显著性的自适应 LLM 量化框架,该框架使用显著性指标评估 transformer 块的重要性,并按显著性应用自适应块级量化。为处理异构计算能力,我们提出基于重要性的参数截断和冻结方案。为解决通信瓶颈,我们提出基于重要性的带宽自适应量化方法,该方法根据重要性和带宽限制动态调整参数精度。为提高全局模型聚合效果,我们提出基于自适应秩-1 矩阵级聚合策略,该策略通过仅聚合 client 更新的秩-1 矩阵来防止信息稀释并加速收敛。在文本分类任务上的实验结果表明,HAFLQ 将内存使用降低 31%,通信成本降低 49%,准确率提高 50%,并实现更快的收敛速度。

关键词

引用

@article{arxiv.2411.06581,
  title  = {HAFLQ: Heterogeneous Adaptive Federated LoRA Fine-tuned LLM with Quantization},
  author = {Yang Su and Na Yan and Yansha Deng and Mischa Dohler and Robert Schober},
  journal= {arXiv preprint arXiv:2411.06581},
  year   = {2025}
}

备注

This is an extended journal version based on our previous conference paper accepted at the 2025 IEEE International Conference on Communications (ICC), with additional sections and new results