中文

基于自适应Transformer块扩展的联邦微调中的灾难性遗忘缓解

机器学习 2025-06-09 v1 分布式、并行与集群计算

摘要

大型语言模型(LLM)的联邦微调(FedFT)已成为在分布式数据环境中适应模型并确保数据隐私的有前景的解决方案。现有FedFT方法主要利用参数高效微调(PEFT)技术以减少通信和计算开销。然而,这些方法往往未能充分应对源于分布式环境中持续适应而产生的灾难性遗忘这一关键挑战。传统的集中式微调方法并非为异构且隐私受限的联邦环境设计,难以有效缓解此问题。此外,由于跨客户端数据分布和设备能力的显著差异,这一挑战进一步加剧,导致遗忘加剧并降低模型泛化能力。为解决这些问题,我们提出FedBE——一种集成自适应Transformer块扩展机制与动态可训练块分配策略的新型FedFT框架。具体而言,FedBE在模型架构中扩展可训练块,通过结构性地分离新学习的任务特定知识与原始预训练表示。此外,FedBE根据客户端的数据分布和计算能力动态分配这些可训练块。这使框架能够更好地适应异构的联邦环境并提升模型的泛化能力。大量实验表明,与现有联邦微调方法相比,FedBE在微调后对通用任务的准确率保持率提升12-74%,模型收敛加速度比例达1.9-3.1倍,且未损害下游任务的准确性。

关键词

引用

@article{arxiv.2506.05977,
  title  = {Mitigating Catastrophic Forgetting with Adaptive Transformer Block Expansion in Federated Fine-Tuning},
  author = {Yujia Huo and Jianchun Liu and Hongli Xu and Zhenguo Ma and Shilong Wang and Liusheng Huang},
  journal= {arXiv preprint arXiv:2506.05977},
  year   = {2025}
}