中文

优化深度神经网络迭代剪枝的学习率调度

机器学习 2023-01-03 v2 人工智能

摘要

学习率(LR)调度对网络剪枝的重要性已在近期若干工作中被观察到。例如,Frankle 和 Carbin(2019)强调,若不应用 LR 预热调度,则无法找到中奖票(即保持准确率的子网络);Renda、Frankle 和 Carbin(2020)证明在每个剪枝周期结束时将 LR 回退至初始状态可提升性能。在本文中,我们首先为 LR 调度这一惊人效应提供理论依据,进而提出一种用于网络剪枝的 LR 调度称为 SILO,即 S 形改进学习率优化(S-shaped Improved Learning rate Optimization)。SILO 优于现有最先进(SOTA)LR 调度的优势有两点:(i)SILO 具有强理论动机,并在剪枝期间动态调整 LR 以改善泛化。具体而言,SILO 以 S 形提升 LR 上界(max_lr)。这在带有 Vision Transformers、ResNet 等多种网络在 ImageNet、CIFAR-10/100 等流行数据集的广泛实验中带来 2% - 4% 的提升。(ii)除强理论动机外,SILO 在经验上是最优的,即匹配一个通过网格搜索穷举寻找 max_lr 最优值的 Oracle。我们发现 SILO 能够精确将 max_lr 的值调整至 Oracle 优化区间内,从而以显著更低复杂度取得与 Oracle 相当的性能。

关键词

引用

@article{arxiv.2212.06144,
  title  = {Optimizing Learning Rate Schedules for Iterative Pruning of Deep Neural Networks},
  author = {Shiyu Liu and Rohan Ghosh and John Tan Chong Min and Mehul Motani},
  journal= {arXiv preprint arXiv:2212.06144},
  year   = {2023}
}

备注

23 Pages. arXiv admin note: text overlap with arXiv:2110.08764