具有相依权重的深度神经网络:高斯过程混合极限、重尾、稀疏性与可压缩性
机器学习
2025-02-06 v2 机器学习
概率论
统计理论
统计理论
摘要
本文研究权重相依且通过混合高斯分布建模的深度前馈神经网络的无限宽度极限。网络的每个隐藏节点被赋予一个非负随机变量,该变量控制该节点输出权重的方差。我们对这些逐节点随机变量做最小假设:它们是独立同分布的,且在无限宽度极限下,每层中它们的和收敛于某个有限随机变量。在此模型下,我们证明无限宽度神经网络的每一层可由两个简单量刻画:一个非负标量参数和一个正实数上的 Lévy 测度。如果所有隐藏层的标量参数严格为正且 Lévy 测度平凡,则恢复经典的高斯过程 (GP) 极限,即由独立同分布高斯权重得到的结果。更有趣的是,如果至少一层的 Lévy 测度非平凡,则在大宽度极限下得到混合高斯过程 (MoGP)。该机制下神经网络的行为与 GP 机制截然不同。输出具有相关性,且服从非高斯分布,可能具有宽尾。此外,我们证明在此机制下权重是可压缩的,且某些节点具有渐近不可忽略的贡献,因此代表了重要的隐藏特征。许多促进稀疏性的神经网络模型可视为我们方法的特例,我们讨论了它们的无限宽度极限;还给出了剪枝误差的渐近分析。我们在模拟数据集、MNIST 和 Fashion MNIST 数据集上展示了 MoGP 机制在表征学习和可压缩性方面相对于 GP 机制的一些优势。
引用
@article{arxiv.2205.08187,
title = {Deep neural networks with dependent weights: Gaussian Process mixture limit, heavy tails, sparsity and compressibility},
author = {Hoil Lee and Fadhel Ayed and Paul Jung and Juho Lee and Hongseok Yang and François Caron},
journal= {arXiv preprint arXiv:2205.08187},
year = {2025}
}
备注
96 pages, 15 figures, 9 tables