深度神经网络中稀疏性的现状
机器学习
2019-02-27 v1 机器学习
摘要
我们在两个大规模学习任务上严格评估了三种用于诱导深度神经网络稀疏性的前沿技术:在 WMT 2014 英德翻译数据上训练的 Transformer,以及在 ImageNet 上训练的 ResNet-50。通过数千次实验,我们证明在较小数据集上可实现高压缩率的复杂技术(Molchanov et al., 2017; Louizos et al., 2017b)表现不稳定,而简单的幅度剪枝方法取得了相当或更好的结果。此外,我们在大规模下复现了(Frankle & Carbin, 2018)和(Liu et al., 2018)的实验,并表明通过剪枝学习的非结构化稀疏架构无法从头训练到与使用联合稀疏化与优化训练的模型相同的测试集性能。总之,这些结果凸显了模型压缩领域对大规模基准的需求。我们开源了代码、表现最优的模型检查点以及所有超参数配置的结果,以为未来压缩与稀疏化工作建立严格基线。
引用
@article{arxiv.1902.09574,
title = {The State of Sparsity in Deep Neural Networks},
author = {Trevor Gale and Erich Elsen and Sara Hooker},
journal= {arXiv preprint arXiv:1902.09574},
year = {2019}
}