中文

你不需要所有的注意力:面向基础模型的分布式动态微调

机器学习 2025-04-18 v1 分布式、并行与集群计算 性能

摘要

微调在通过最小训练 effort 适应模型以处理下游任务方面发挥着关键作用。然而,基础模型的规模迅速增加,给大多数商业设备(通常内存带宽有限)适配基础模型微调提出了巨大挑战。诸如模型分片和张量并行等技术通过在多个设备上分布计算来满足内存需求,但这些方法并未充分利用基础模型的特性来促进微调过程,导致高计算成本和工作负载不均衡。我们引入一种新的分布式动态微调 (D2FT) 框架,通过观察在基础模型微调中并非所有注意力模块对前向和反向传播都是必需的,战略性地协调注意力模块之间的操作。通过三种创新的选择策略,D2FT显著减少了微调基础模型所需的计算工作量。此外,D2FT通过多背包优化来优化这些选择策略,以解决分布式计算环境中的工作负载不均衡问题。我们的实验结果表明,所提出的D2FT框架在CIFAR-10、CIFAR-100和Stanford Cars数据集上,训练计算成本降低40%,训练通信成本降低50%,仅有1%至2%的准确度下降。此外,结果表明D2FT可以有效扩展到最新的方法——LoRA,这是一种领先的参数高效微调技术。通过降低40%的计算成本或50%的通信成本,D2FT LoRA在Stanford Cars数据集上top-1准确度仅下降4%至6%。

关键词

引用

@article{arxiv.2504.12471,
  title  = {You Don't Need All Attentions: Distributed Dynamic Fine-Tuning for Foundation Models},
  author = {Shiwei Ding and Lan Zhang and Zhenlin Wang and Giuseppe Ateniese and Xiaoyong Yuan},
  journal= {arXiv preprint arXiv:2504.12471},
  year   = {2025}
}