中文

FZOO:面向 Adam 规模速度的快速零阶优化器用于大语言模型微调

机器学习 2025-07-01 v2 人工智能

摘要

大型语言模型(LLM)的微调常常面临 GPU 内存瓶颈:一阶优化器如 Adam 的反向传播会将内存使用增加到推理水平的十倍以上(例如 OPT-30B 达 633 GB)。零阶(ZO)优化器通过仅从正向传递估计梯度来避免此开销,然而像 MeZO 这样的现有方法通常需要更多的迭代步骤才能收敛。在这种速度与内存之间的权衡能否被根本改善?标准化 SGD 在实证上表现出强大的性能,同时比 Adam 更具内存效率。在此基础上,我们引入 FZOO,一个面向 Adam 规模速度的快速零阶优化器。FZOO 通过采用批量单边估计,结合基于批次损失标准差自适应步长,从而大幅减少收敛所需的总正向传递次数。它还通过采用 Rademacher 随机向量扰动结合 CUDA 的并行处理加速每个批次的计算。针对 RoBERTa-large、OPT(350M-66B)、Phi-2 和 Llama3 等多种模型,在 11 个任务上进行大规模实验,验证了 FZOO 的有效性。平均情况下,FZOO 在准确率上比 MeZO 高出 3 个百分点,且正向传递次数减少 3 倍。对于 RoBERTa-large,FZOO 在准确率上平均提升 5.6 个百分点,正向传递次数减少 18 倍,收敛速度接近 Adam。我们还提供理论分析,证明 FZOO 在形式上等价于标准化 SGD 更新规则,并给出收敛保证。FZOO 可无缝集成到 PEFT 技术中,进一步实现更大的内存节省。总体而言,我们的结果使单 GPU 高速、全参数微调变为可行,并指向基于内存高效预训练的未来工作方向。

关键词

引用

@article{arxiv.2506.09034,
  title  = {FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed},
  author = {Sizhe Dang and Yangyang Guo and Yanjun Zhao and Haishan Ye and Xiaodong Zheng and Guang Dai and Ivor Tsang},
  journal= {arXiv preprint arXiv:2506.09034},
  year   = {2025}
}