中文

基于低秩结构的零阶精调语言模型增强方法

机器学习 2024-10-11 v1

摘要

参数高效微调(PEFT)显著减少了大型语言模型(LLMs)在下游应用中进行微调的内存成本。然而,传统的一阶(FO)微调算法由于需要在梯度计算期间存储激活值,在长上下文微调任务中会产生巨大的内存开销。零阶(ZO)算法通过使用函数值的有限差分来近似梯度,无需激活存储,成为一个有前景的替代方案。然而,现有的ZO方法难以捕捉LLM微调中常见的低秩梯度结构,导致性能次优。本文提出一种低秩ZO梯度估计器,引入一种新颖的低秩ZO算法(LOZO),有效地捕捉了LLMs中的这种结构。我们通过将其框架化为子空间优化方法,为LOZO提供了收敛保证。此外,由于其低秩特性,LOZO可以与动量技术集成,同时几乎没有额外的内存开销。广泛的实验在各种模型规模和下游任务上表明,LOZO及其基于动量的变体均优于现有的ZO方法,并接近FO算法的性能。

关键词

引用

@article{arxiv.2410.07698,
  title  = {Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures},
  author = {Yiming Chen and Yuan Zhang and Liyuan Cao and Kun Yuan and Zaiwen Wen},
  journal= {arXiv preprint arXiv:2410.07698},
  year   = {2024}
}