中文

解构彩票:零、符号与超掩码

机器学习 2020-03-04 v4 计算机视觉与模式识别 机器学习

摘要

Frankle & Carbin 最近的“彩票假设”论文表明,一种创建稀疏网络的简单方法(保留大权重)所得到的模型可以从头开始训练,但前提是必须从相同的初始权重开始。这些网络的性能通常超过非稀疏基线模型,但其原因此前并未得到很好的理解。本文研究了彩票(LT)算法的三个关键组件,表明每个组件都可以发生显著变化而不影响整体结果。对这些因素进行消融分析,为 LT 网络为何能取得如此优异的性能提供了新的见解。我们阐明了为何将权重置零很重要,为何仅需符号即可使重新初始化的网络开始训练,以及为何掩码的行为类似于训练。最后,我们发现了超掩码的存在,将其应用于未经训练的随机初始化网络,即可产生性能远超随机水平(在 MNIST 上为 86%,在 CIFAR-10 上为 41%)的模型。

关键词

引用

@article{arxiv.1905.01067,
  title  = {Deconstructing Lottery Tickets: Zeros, Signs, and the Supermask},
  author = {Hattie Zhou and Janice Lan and Rosanne Liu and Jason Yosinski},
  journal= {arXiv preprint arXiv:1905.01067},
  year   = {2020}
}

备注

NeurIPS 2019 camera ready version