中文

SGD中的重尾分布与过参数化神经网络的可压缩性

机器学习 2021-06-08 v1 机器学习

摘要

神经网络压缩技术已日益流行,因为它们能大幅降低超大型网络的存储与计算需求。近期的实证研究已表明,即便简单的剪枝策略也可能出奇地有效,且若干理论研究已证明可压缩网络(在特定意义上)应能获得较低的泛化误差。然而,关于使网络适用于此类简单压缩方案的根本原因的理論刻画仍然缺失。在本研究中,我们针对这一基本问题,揭示训练算法的动态过程在获得此类可压缩网络中起着关键作用。我们将注意力集中于随机梯度下降(SGD),主要贡献在于将可压缩性与SGD近期确立的两个性质联系起来:(i) 当网络规模趋于无穷时,系统可收敛至平均场极限,此时网络权重表现为相互独立;(ii) 对于较大的步长/批大小比,SGD迭代可收敛至重尾平稳分布。当这两种现象同时发生时,我们证明网络保证是“p\ell_p-可压缩的”,且不同剪枝技术(幅度剪枝、奇异值剪枝或节点剪枝)的压缩误差随网络规模增大而任意变小。我们进一步证明了适配于我们理论框架的泛化界,其确实证实更可压缩的网络泛化误差更低。我们的理论与在多种神经网络上的数值研究均表明,大步长/批大小比会引入重尾,而其与过参数化相结合会导致可压缩性。

关键词

引用

@article{arxiv.2106.03795,
  title  = {Heavy Tails in SGD and Compressibility of Overparametrized Neural Networks},
  author = {Melih Barsbey and Milad Sefidgaran and Murat A. Erdogdu and Gaël Richard and Umut Şimşekli},
  journal= {arXiv preprint arXiv:2106.03795},
  year   = {2021}
}