ZO-AdaMU优化器:通过动量和不确定性自适应零阶优化中的扰动
机器学习
2023-12-27 v1
摘要
降低大模型全参数训练的内存需求已成为研究热点。MeZO仅通过前向传播在零阶SGD优化器(ZO-SGD)中微调大语言模型,在推理时使用相同GPU内存表现出色。然而,MeZO中用于梯度估计的模拟扰动随机近似导致严重振荡和大量时间开销。此外,没有动量正则化导致严重过拟合问题。最后,ZO-SGD上与扰动无关的动量不改善收敛速度。本研究提出ZO-AdaMU,通过在其随机近似中自适应模拟扰动的动量来解决上述问题。与现有自适应动量方法不同,我们将动量重新定位到随机梯度近似中的模拟扰动上。我们的收敛分析和实验证明,这是改善ZO-SGD收敛稳定性和速度的更好方式。大量实验表明,ZO-AdaMU在各种NLP任务的LLM微调中比MeZO及其动量变体具有更好的泛化能力。
引用
@article{arxiv.2312.15184,
title = {ZO-AdaMU Optimizer: Adapting Perturbation by the Momentum and Uncertainty in Zeroth-order Optimization},
author = {Shuoran Jiang and Qingcai Chen and Youchen Pan and Yang Xiang and Yukang Lin and Xiangping Wu and Chuanyi Liu and Xiaobao Song},
journal= {arXiv preprint arXiv:2312.15184},
year = {2023}
}