中文

模型压缩中过参数化的可证明益处:从双下降至神经网络剪枝

机器学习 2020-12-17 v1 机器学习

摘要

深度网络通常以远多于训练数据集规模的参数量进行训练。最近的实证证据表明,过参数化的做法不仅有益于训练大型模型,也——或许有违直觉地——有助于构建轻量模型。具体而言,它表明过参数化有益于模型剪枝/稀疏化。本文通过从理论上刻画过参数化 regime(区间)下模型剪枝的高维渐近性,阐明了这些实证发现。所提出的理论解决了以下核心问题:“应从头训练小模型,还是先训练大模型再剪枝?”。我们解析地识别出若干区间:即便已知最具信息性特征的位置,先拟合大模型再剪枝也优于仅用已知信息性特征训练。这导致了稀疏模型训练中的一种新双下降:在保持目标稀疏度的同时增大原始模型,可在越过过参数化阈值后提升测试精度。我们的分析进一步通过将重训练益处与特征相关性相联系,揭示了重训练的好处。我们发现上述现象已存在于线性和随机特征模型中。我们的技术方法推进了高维分析的工具集,并精确刻画了过参数化最小二乘的渐近分布。通过解析研究更简单模型所获得的直觉,在神经网络上得到了数值验证。

关键词

引用

@article{arxiv.2012.08749,
  title  = {Provable Benefits of Overparameterization in Model Compression: From Double Descent to Pruning Neural Networks},
  author = {Xiangyu Chang and Yingcong Li and Samet Oymak and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2012.08749},
  year   = {2020}
}

备注

to appear at AAAI 2021