中文

高维随机梯度估计的 Stein-规则收缩

机器学习 2026-02-10 v2 人工智能 统计理论 机器学习 统计理论

摘要

随机梯度方法是大规模学习的核心,但它们将小批量梯度视为无偏估计器,而古典决策理论表明在高维情况下,这些估计器是不可接受的。我们将梯度计算建模为高维估计问题,提出基于Stein-规则收缩的框架。我们构建的梯度估计器会自适应地收缩向历史动量衍生的稳定梯度。收缩强度通过数据驱动方式确定,利用自适应优化器的统计量估计梯度噪声方差。在高斯噪声模型下,我们证明该估计器在平方损失下均匀优于标准随机梯度,并实现最小逼近极限。我们将其集成到Adam优化器中,得到SR-Adam算法,计算开销可忽略不计。在CIFAR10和CIFAR100上的实验表明,在大批量情境下,SR-Adam相较于Adam consistently取得改进。消融研究显示,收缩主要来源于对卷积层等高维参数的选择性应用,而对所有参数的无差别收缩会降低性能。这些结果表明,经典收缩原理为改进深度学习中的随机梯度估计提供了原则化方法。

关键词

引用

@article{arxiv.2602.01777,
  title  = {Stein-Rule Shrinkage for Stochastic Gradient Estimation in High Dimensions},
  author = {M. Arashi and M. Amintoosi},
  journal= {arXiv preprint arXiv:2602.01777},
  year   = {2026}
}