中文

Bilevel ZOFO:高效LLM微调与元训练

机器学习 2025-12-16 v3

摘要

使用一阶(FO)优化器对预训练的大型语言模型(LLM)进行下游任务微调面临显著计算挑战。参数高效微调(PEFT)方法通过冻结大多数模型参数仅训练少量参数来缓解这些挑战,但PEFT在需要高任务特定准确率时常表现不如完全微调。零阶(ZO)方法在没有反向传播的情况下通过仅使用前向传递来估计梯度,对整个预训练模型进行微调。虽然内存高效,但ZO方法收敛缓慢且对提示选择高度敏感。我们提出Bilevel-ZOFO,将快速、局部FO-PEFT适应与稳定、内存高效的ZO更新组合,通过双层优化方法连接这两个世界。FO-PEFT内层循环进行快速、低内存的局部适应,减少ZO估计的方差并稳定搜索,指导外层ZO对完整主干的更新,减少提示敏感性。同时,外层ZO提供更好的泛化能力。我们提供理论收敛保证,并通过实验演示Bilevel-ZOFO显著优于现有ZO和FO-PEFT方法,实现训练速度提升2-4倍,同时保持类似的内存效率。此外,我们通过ZO更新主干并仅为每个任务适应微小的FO-PEFT模块,Bilevel-ZOFO组合了全模型容量与少样本效率,成为一种非常高效的元学习算法,能够快速适应新任务。

关键词

引用

@article{arxiv.2502.03604,
  title  = {Bilevel ZOFO: Efficient LLM Fine-Tuning and Meta-Training},
  author = {Reza Shirkavand and Peiran Yu and Qi He and Heng Huang},
  journal= {arXiv preprint arXiv:2502.03604},
  year   = {2025}
}