基于零阶优化的量化神经网络微调
机器学习
2026-02-13 v3 计算与语言
计算机视觉与模式识别
摘要
随着大型语言模型规模的指数增长,GPU内存已成为将这些模型适配到下游任务的瓶颈。本文旨在通过最小化模型权重、梯度和优化器状态的内存使用,在统一框架内推动内存高效训练的极限。我们的想法是利用零阶优化消除梯度和优化器状态,该方法通过在正向传播期间扰动权重来近似梯度方向以识别梯度方向。为最小化权重的内存使用,我们采用模型量化,例如从bfloat16转换为int4。然而,由于离散权重与连续梯度之间的精度差距,直接对量化权重应用零阶优化是不可行的,否则需要反量化再量化。为克服这一挑战,我们提出了量化零阶优化(Quantized Zeroth-order Optimization, QZO),一种简单而有效的方法,通过扰动连续量化尺度进行梯度估计,并使用方向导数裁剪方法稳定训练。QZO与基于标量的和基于码本的训练后量化方法均正交。与16位全参数微调相比,QZO可将4位LLM的总内存成本降低超过18倍,并可在单个24GB GPU上微调Llama-2-13B。
引用
@article{arxiv.2505.13430,
title = {Fine-tuning Quantized Neural Networks with Zeroth-order Optimization},
author = {Sifeng Shang and Jiayi Zhou and Chenyu Lin and Minxian Li and Kaiyang Zhou},
journal= {arXiv preprint arXiv:2505.13430},
year = {2026}
}
备注
Accepted by ICLR 2026