中文

操纵彩票:让所有票都成为赢家

机器学习 2021-07-26 v3 计算机视觉与模式识别 机器学习

摘要

许多应用由于空间或推理时间限制而需要稀疏神经网络。已有大量工作致力于训练稠密网络以得到用于推理的稀疏网络,但这将可训练的最大稀疏模型规模限制为可训练的最大稠密模型规模。本文提出一种方法,在训练全程使用固定的参数数量和固定的计算代价来训练稀疏神经网络,且不牺牲相对于现有稠密到稀疏训练方法的精度。我们的方法在训练期间通过使用参数幅值和稀疏的梯度计算来更新稀疏网络的拓扑结构。我们表明,与先前技术相比,该方法达到给定精度水平所需的浮点运算次数(FLOPs)更少。我们在多种网络和数据集上展示了最先进的稀疏训练结果,包括 ResNet-50、Imagenet-2012 上的 MobileNets 以及 WikiText-103 上的 RNNs。最后,我们提供了一些见解,说明为何在优化过程中允许拓扑变化能够克服拓扑保持静态时遇到的局部极小值。我们工作中使用的代码可在 github.com/google-research/rigl 找到。

关键词

引用

@article{arxiv.1911.11134,
  title  = {Rigging the Lottery: Making All Tickets Winners},
  author = {Utku Evci and Trevor Gale and Jacob Menick and Pablo Samuel Castro and Erich Elsen},
  journal= {arXiv preprint arXiv:1911.11134},
  year   = {2021}
}

备注

Published in Proceedings of the 37th International Conference on Machine Learning. Code can be found in github.com/google-research/rigl