中文

按样本梯度:理解与改进优化器的新视野

机器学习 2026-03-03 v2

摘要

深度学习中的训练算法通常将一小批样本视为单个对象;它们对小批量梯度进行平均,然后以各种方式处理平均值。计算平均值之外的其他统计数据可能被视为在自动微分 (AD) 框架中资源密集型。我们展示这并非如此。一般而言,梯度统计可以通过对 AD 图进行手术来实现,这在某些情况下,与小批量梯度计算几乎没有计算和内存开销。此外,我们展示在包括变换器在内的某些模型类中,JAX 的矢量化转换提供了一种可行的原型设计和实验方法。我们随后通过按样本梯度转换的视角修正我们对两种非线性操作在优化中理解。我们首先研究 signSGD,表明 sign 操作在梯度处理链中的最佳位置对于成功至关重要,并且可以用简单的信噪比论证来预测。接下来我们研究按样本变化的 Adam 预条件器,表明优化最好由梯度分布的均值主导,而非方差——这与通常的见解相反。总体而言,我们演示了按样本梯度信息使得新的分析和算法设计成为可能。

关键词

引用

@article{arxiv.2510.00236,
  title  = {Per-example gradients: a new frontier for understanding and improving optimizers},
  author = {Vincent Roulet and Atish Agarwala},
  journal= {arXiv preprint arXiv:2510.00236},
  year   = {2026}
}