中文

Powerpropagation:一种诱导稀疏性的权重重参数化方法

机器学习 2021-10-07 v2 人工智能 机器学习

摘要

稀疏神经网络的训练正日益成为降低模型在训练和评估时计算开销以及实现模型有效扩展的重要工具。尽管多年来大量工作致力于专门的剪枝技术,但基于梯度的训练对模型稀疏性的固有影响却鲜受关注。在本文中,我们提出 Powerpropagation,一种用于神经网络的新型权重参数化方法,可得到固有稀疏的模型。利用梯度下降的行为,我们的方法产生的权重更新呈现出“富者愈富”的动态,使低幅值参数基本不受学习影响。以此方式训练的模型表现出相似性能,但其分布中零值处的密度显著更高,从而可更安全地剪除更多参数。Powerpropagation 通用、直观、廉价且易于实现,并可轻松与其他多种技术结合。为彰显其通用性,我们在两种截然不同的场景中进行了探索:首先,遵循近期工作脉络,我们研究其在资源受限场景下稀疏训练中的作用。在此,我们将 Powerpropagation 与传统权重剪枝技术以及近期最先进的稀疏到稀疏算法结合,在 ImageNet 基准上展现出更优性能。其次,我们倡导利用稀疏性克服灾难性遗忘,其中压缩表示可在固定模型容量下容纳大量任务。在所有情况下,我们的重参数化都显著提升了现有方法的效果。

关键词

引用

@article{arxiv.2110.00296,
  title  = {Powerpropagation: A sparsity inducing weight reparameterisation},
  author = {Jonathan Schwarz and Siddhant M. Jayakumar and Razvan Pascanu and Peter E. Latham and Yee Whye Teh},
  journal= {arXiv preprint arXiv:2110.00296},
  year   = {2021}
}

备注

Accepted at NeurIPS 2021