VAMO:高效零阶方差归约 SGD 优化器
机器学习
2025-09-30 v2 最优化与控制
摘要
优化大规模非凸问题是深度学习中常见的需求,需要在快速收敛与计算效率之间进行权衡。一阶 (FO) 优化器作为今天的基准,提供快速收敛和良好泛化,但常因现代模型规模大而产生高计算和内存开销。相比,零阶 (ZO) 方法通过估计梯度来降低负担,但其在高维场景下的慢收敛限制了实际应用。我们引入 VAMO (VAriance-reduced Mixed-gradient Optimizer),一种随机方差归约方法,将 mini-batch SGD 与全批 ZO 梯度结合,基于 SVRG 框架实现。VAMO 的混合设计利用两点 ZO 估计器,实现维度无关的收敛率 ,其中 为迭代次数, 为 batch 大小,超越纯 ZO 方法的维度依赖性减慢,显著优于 SGD 的 收敛率。此外,我们提出一种多点变体,通过调整估计点数量来平衡收敛速度与计算成本,以缓解 的误差。重要的是,VAMO 以较小的动态内存要求实现上述收益,相较于许多 FO 基准更具吸引力,尤其适用于边缘部署。包括传统神经网络训练和大语言模型微调在内的实验表明,VAMO 不仅在性能上超越了既定的 FO 与 ZO 方法,而且还以轻便的内存占用实现了这一点。
引用
@article{arxiv.2505.13954,
title = {VAMO: Efficient Zeroth-Order Variance Reduction for SGD with Faster Convergence},
author = {Jiahe Chen and Ziye Ma},
journal= {arXiv preprint arXiv:2505.13954},
year = {2025}
}