中文

低秩梯度及其发现地点

机器学习 2025-10-03 v1 人工智能 机器学习

摘要

本文探讨了在放宽训练数据和参数常规各向同性假设的前提下,两层神经网络训练损失梯度中的低秩结构。我们考虑一种脉冲数据模型,其中 bulk 可呈各向异性且条件不良,不要求数据和权重矩阵独立,我们也分析了均值场和神经-切线-核比例。我们证明,相对于输入权重的梯度近似低秩,且由两个秩一项主导:一个与 bulk 数据残差对齐,另一个与输入数据中的秩一脉冲对齐。我们描述了训练数据的属性、比例制度和激活函数如何支配这两个组成部分之间的平衡。此外,我们还表明标准正则化器,如权力衰减、输入噪声和雅可比惩罚,也会选择性地调节这些组成部分。合成数据和真实数据的实验证实了我们的理论预测。

关键词

引用

@article{arxiv.2510.01303,
  title  = {Low Rank Gradients and Where to Find Them},
  author = {Rishi Sonthalia and Michael Murray and Guido Montúfar},
  journal= {arXiv preprint arXiv:2510.01303},
  year   = {2025}
}