中文

Sparse MeZO:零阶大语言模型微调中更少参数实现更优性能

机器学习 2026-02-17 v2 人工智能 计算与语言

摘要

虽然针对特定任务微调大语言模型(LLM)通常能产生令人印象深刻的结果,但由于基于梯度的训练中的反向传播,其代价是内存效率低下。最近提出的内存高效零阶(MeZO)优化器旨在解决这一问题,它们在训练过程中仅需前向传播,从而更加节省内存。然而,与精确梯度相比,基于零阶(ZO)的梯度通常表现出估计误差,这会显著损害优化过程,导致收敛速度变慢和次优解。此外,我们发现当将估计误差加到大权重上时,其负面影响比加到小权重上更为严重。基于这一观察,本文介绍了 Sparse MeZO,这是一种新颖的内存高效零阶优化方法,仅对精心选择的参数子集应用 ZO。我们提出了一种简单而有效的参数选择方案,使 Sparse-MeZO 获得了显著的性能提升。此外,我们开发了一种针对稀疏掩码的内存优化实现,确保该算法仅需推理级别的内存消耗,使得 Sparse-MeZO 能够在单张 A100 GPU 上微调 LLaMA-30b。实验结果表明,Sparse-MeZO 在无任何额外开销的情况下,在性能和收敛速度上均持续优于 MeZO。例如,在 RTE 任务上,其绝对准确率比 MeZO 提高了 9%,速度提升了 3.5 倍。代码地址:https://github.com/NUS-HPC-AI-Lab/SparseMeZO。

关键词

引用

@article{arxiv.2402.15751,
  title  = {Sparse MeZO: Less Parameters for Better Performance in Zeroth-Order LLM Fine-Tuning},
  author = {Yong Liu and Zirui Zhu and Chaoyu Gong and Minhao Cheng and Cho-Jui Hsieh and Yang You},
  journal= {arXiv preprint arXiv:2402.15751},
  year   = {2026}
}

备注

Accepted by NeurIPS 2025