中文

HELENE:基于Hessian分层裁剪和梯度退火加速LLM零阶优化微调

机器学习 2024-11-19 v1 人工智能

摘要

微调大型语言模型(LLM)面临显著的内存挑战,尤其是在模型规模不断增大的背景下,反向传播过程需要大量资源。最近的工作MeZO使用零阶(ZO)优化方法来解决这一问题,通过匹配推理阶段的用量来降低内存消耗。然而,MeZO因模型参数间曲率差异导致收敛速度较慢。为克服这一限制,我们引入HELENE,一种新型可扩展且高效的优化器,集成了退火A-GNB梯度与对角Hessian估计以及分层裁剪,作为二阶预条件器。这种组合允许更快更稳定的收敛。我们的理论分析表明,HELENE在提高收敛率方面尤其适用于具有异构层维度的模型,通过减少对总参数空间维度的依赖,使其规模仅受最大层维度制约,非常适合现代LLM架构。在RoBERTa-large和OPT-1.3B上的多个任务实验表明,HELENE相较于MeZO实现了最高可达20倍的加速,平均准确率提升1.5%。此外,HELENE与完整参数调优和参数高效微调(PEFT)均兼容,优于多个最新优化器。代码将在审稿后发布。

关键词

引用

@article{arxiv.2411.10696,
  title  = {HELENE: Hessian Layer-wise Clipping and Gradient Annealing for Accelerating Fine-tuning LLM with Zeroth-order Optimization},
  author = {Huaqin Zhao and Jiaxi Li and Yi Pan and Shizhe Liang and Xiaofeng Yang and Wei Liu and Xiang Li and Fei Dou and Tianming Liu and Jin Lu},
  journal= {arXiv preprint arXiv:2411.10696},
  year   = {2024}
}