中文

神经网络中超越初始化的高斯性

机器学习 2025-10-08 v1 人工智能 高能物理 - 理论

摘要

我们通过在 MNIST 分类问题中研究神经网络权重矩阵的演化过程,测试了矩阵模型在表示其分布方面效果的假设——即在高斯性和置换对称性假设下的有效性。发现通用的 13 参数置换不变高斯矩阵模型能够有效地表示权重矩阵中的相关高斯性,这超出了简单以独立同分布矩阵变量为前提的高斯模型适用范围的界限,尤其在初始化步骤之后也表现良好。表示论模型参数以及置换不变矩阵可观测量的图论特征描述,提供了最佳拟合模型以及小幅偏离高斯性的可解释框架。此外,计算了该类模型的 Wasserstein 距离,并用于量化训练过程中分布的移动。本文中考察了各种初始化方案、正则化、层数和层宽的影响,识别了特定偏离高斯性被放大的极限,并探讨了如何发展更一般且仍高度可解释的模型。

关键词

引用

@article{arxiv.2510.05218,
  title  = {Approximate Gaussianity Beyond Initialisation in Neural Networks},
  author = {Edward Hirst and Sanjaye Ramgoolam},
  journal= {arXiv preprint arXiv:2510.05218},
  year   = {2025}
}

备注

26+34 pages, 15 figures, 12 tables