用重尾 SGD 训练的过参数化神经网络的隐式可压缩性
机器学习
2024-02-13 v2 机器学习
概率论
摘要
神经网络压缩已成为一个日益重要的课题,不仅因其实际相关性,也因其理论意义,因为可压缩性与泛化误差之间存在显式联系。近期研究表明,随机梯度下降(SGD)超参数的选择会影响所学参数向量的可压缩性。然而,这些结果依赖于不可验证的假设,且所得理论因其隐式性无法提供实用指导。在本研究中,我们为 SGD 提出一种简单修正,使得算法输出可在不做任何非平凡假设下被证明可压缩。我们考虑用 SGD 训练的单隐藏层神经网络,并表明若我们在每次迭代对迭代量注入加性重尾噪声,则对任意压缩率,存在某一过参数化水平使得算法输出以高概率可压缩。为得到该结果,我们做出两项主要技术贡献:(i) 我们证明了一类重尾随机微分方程的“混沌传播”结果,以及 (ii) 我们推导了它们 Euler 离散化的误差估计。我们的实验表明,所提方法不仅在多种模型和数据集上实现了增强的可压缩性,而且即使在超出我们理论设定的更现实架构下,也能在剪枝下带来鲁棒测试性能。
引用
@article{arxiv.2306.08125,
title = {Implicit Compressibility of Overparametrized Neural Networks Trained with Heavy-Tailed SGD},
author = {Yijun Wan and Melih Barsbey and Abdellatif Zaidi and Umut Simsekli},
journal= {arXiv preprint arXiv:2306.08125},
year = {2024}
}
备注
31 pages, 2 figures