重尾机制普适性模型
机器学习
2025-06-05 v1 机器学习
摘要
近期在深度学习中的理论与实证成功,包括著名的神经网络比例定律(neural scaling laws),但也观察到许多感兴趣的对象呈现某种形式的重尾或幂律行为。特别是,Jacobians、Hessians 和权重矩阵中频繁出现的重尾谱密度,导致引入重尾机制普适性(HT-MU)的概念。多方实证证据表明,重尾指标与模型性能之间存在稳健的相关性,表明HT-MU可能是深度学习有效性的基本方面。本文提出一 general family of random matrix models——高温马尔克肯-帕斯特ur(HTMP)套件——来探讨引发神经网络中重尾行为的属性。在该模型下,具有幂律尾部(上和下)的谱密度通过三个独立因素的组合而产生:数据中复杂的相关结构;训练期间的降低温度;以及降低特征向量熵。这些现象作为模型结构中的隐式偏好出现,并且可以通过控制“特征值排斥”参数来调控。本文讨论了HT-MU在其他重尾现象中的影响,包括神经网络比例定律、优化器轨迹以及神经网络训练的五加一相位。
引用
@article{arxiv.2506.03470,
title = {Models of Heavy-Tailed Mechanistic Universality},
author = {Liam Hodgkinson and Zhichao Wang and Michael W. Mahoney},
journal= {arXiv preprint arXiv:2506.03470},
year = {2025}
}
备注
40 pages, 4 figures