以稀疏之价获稠密:通过子空间偏移提升稀疏初始化网络的性能
机器学习
2022-01-28 v2
摘要
神经网络可被剪枝至高稀疏度并保持高准确率,这一点已得到充分确立。近期研究致力于在初始化后立即剪枝,以使稀疏性带来的计算节省延伸至训练过程。本文引入一种全新的「DCT加稀疏」层架构,即便仅保留0.01%可训练核参数,也能维持信息传播与可训练性。我们表明,使用这些层构建、且在初始化时剪枝的网络进行标准训练,在多种基准网络架构与数据集上实现了极端稀疏度下的state-of-the-art准确率。此外,这些结果仅使用简单启发式方法确定网络中可训练参数的位置即可取得,因此无需如竞争性的初始化时剪枝算法那样初始存储或计算完整未剪枝网络。从标准稀疏层切换至DCT加稀疏层不会增加网络的存储占用,且仅带来微小的额外计算开销。
引用
@article{arxiv.2102.07655,
title = {Dense for the Price of Sparse: Improved Performance of Sparsely Initialized Networks via a Subspace Offset},
author = {Ilan Price and Jared Tanner},
journal= {arXiv preprint arXiv:2102.07655},
year = {2022}
}
备注
18 pages, 15 figures