中文

HiFT:一种分层全参数微调策略

机器学习 2024-06-18 v3 计算与语言

摘要

全参数微调因其卓越的性能,已成为将语言模型(LM)适配到下游任务的首选方法。随着语言模型规模的增大,微调语言模型的全参数需要极其庞大的GPU内存。现有方法利用零阶优化器来节省GPU内存,但这可能会损害语言模型的性能,因为非零阶优化器在大多数下游任务上往往更容易收敛。在本文中,我们提出了一种新颖的、与优化器无关的端到端分层微调策略HiFT,该策略在每个训练步骤只更新一部分参数。HiFT可以同时显著减少驻留在GPU内存中的梯度和优化器状态参数量,从而降低GPU内存使用。我们的结果表明:(1)HiFT实现了与参数高效微调和标准全参数微调相当的性能。(2)HiFT支持多种优化器,包括AdamW、AdaGrad、SGD等。(3)对于7B模型,与标准全参数微调相比,HiFT可以节省超过60%的GPU内存。(4)HiFT能够在单张48G A6000上,使用AdamW优化器,以32位精度对7B模型进行全参数微调,无需使用任何内存节省技术。

关键词

引用

@article{arxiv.2401.15207,
  title  = {HiFT: A Hierarchical Full Parameter Fine-Tuning Strategy},
  author = {Yongkang Liu and Yiqun Zhang and Qian Li and Tong Liu and Shi Feng and Daling Wang and Yifei Zhang and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2401.15207},
  year   = {2024}
}

备注

under progress