随机剪枝即启动稀疏训练所需的一切
机器学习
2023-06-01 v2
摘要
随机掩码定义出令人惊讶地有效的稀疏神经网络模型,这一点已被经验证明。由此得到的稀疏网络通常能与稠密架构和最先进的彩票票剪枝算法竞争,尽管它们不依赖计算昂贵的剪枝-训练迭代,并且初始即可抽取而无需显著计算开销。我们提供理论解释:若随机掩码的宽度按逆稀疏度 的对数因子更宽,则可逼近任意目标网络。该过参数化因子对于 3 层随机网络至少是必需的,这阐明了观测到的随机网络在更高稀疏度下性能退化现象。然而,在中等到高稀疏度水平,我们的结果表明更稀疏的网络包含于随机源网络中,从而任何稠密到稀疏的训练方案都可通过将搜索约束于固定随机掩码而转化为计算更高效的稀疏到稀疏方案。我们在不同剪枝方法的实验中证明了该方法的可行性,并提出了随机源网络初始逐层稀疏比 particularly effective 的选择。作为一个特例,我们从理论和实验上表明随机源网络也包含强彩票票。
引用
@article{arxiv.2210.02412,
title = {Why Random Pruning Is All We Need to Start Sparse},
author = {Advait Gadhikar and Sohom Mukherjee and Rebekka Burkholz},
journal= {arXiv preprint arXiv:2210.02412},
year = {2023}
}
备注
Accepted for publication at ICML, 2023