中文

VAMO:高效零阶方差归约 SGD 优化器

机器学习 2025-09-30 v2 最优化与控制

摘要

优化大规模非凸问题是深度学习中常见的需求,需要在快速收敛与计算效率之间进行权衡。一阶 (FO) 优化器作为今天的基准,提供快速收敛和良好泛化,但常因现代模型规模大而产生高计算和内存开销。相比,零阶 (ZO) 方法通过估计梯度来降低负担,但其在高维场景下的慢收敛限制了实际应用。我们引入 VAMO (VAriance-reduced Mixed-gradient Optimizer),一种随机方差归约方法,将 mini-batch SGD 与全批 ZO 梯度结合,基于 SVRG 框架实现。VAMO 的混合设计利用两点 ZO 估计器,实现维度无关的收敛率 O(1/T+1/b)\mathcal{O}(1/T + 1/b),其中 TT 为迭代次数,bb 为 batch 大小,超越纯 ZO 方法的维度依赖性减慢,显著优于 SGD 的 O(1/T)\mathcal{O}(1/\sqrt{T}) 收敛率。此外,我们提出一种多点变体,通过调整估计点数量来平衡收敛速度与计算成本,以缓解 O(1/b)O(1/b) 的误差。重要的是,VAMO 以较小的动态内存要求实现上述收益,相较于许多 FO 基准更具吸引力,尤其适用于边缘部署。包括传统神经网络训练和大语言模型微调在内的实验表明,VAMO 不仅在性能上超越了既定的 FO 与 ZO 方法,而且还以轻便的内存占用实现了这一点。

关键词

引用

@article{arxiv.2505.13954,
  title  = {VAMO: Efficient Zeroth-Order Variance Reduction for SGD with Faster Convergence},
  author = {Jiahe Chen and Ziye Ma},
  journal= {arXiv preprint arXiv:2505.13954},
  year   = {2025}
}