高维梯度下降随机梯度下降扩张极限的普遍性
机器学习
2025-12-23 v2 机器学习
概率论
统计理论
统计理论
摘要
我们考虑高维统计任务,其损失仅依赖于数据在由参数向量和某些真实向量张成的固定维子空间中的投影。这包括使用交叉熵损失对混合分布进行分类(一个和两层网络),以及使用一个和两层网络学习单指数模型和多指数模型。当数据绘制自各向同性高斯混合分布时,已知在随机梯度下降下,随着维度和样本量趋于无穷大,步长趋于零的同时,有限家族摘要统计的演化收敛于自主常微分方程(ODE)。我们的主要结果是,这些 ODE 极限在普遍性上是通用的,即只要数据绘制自任意乘积分布的混合物,其前两时刻与相应的高斯分布匹配,且初始化向量和真实向量为坐标分散,即可实现相同的极限。我们通过两个相应的非普遍性结果来补充这一点。我们提供了一个简单例子,说明如果初始化是坐标对齐的,ODE 极限则非普遍。我们还显示,围绕 ODE 不动点的摘要统计的随机微分方程极限(作为波动)并非普遍。
引用
@article{arxiv.2512.13634,
title = {Universality of high-dimensional scaling limits of stochastic gradient descent},
author = {Reza Gheissari and Aukosh Jagannath},
journal= {arXiv preprint arXiv:2512.13634},
year = {2025}
}
备注
Added references and additional context. 31 pages