中文

探寻稀疏双下降现象的解药

人工智能 2023-09-01 v1

摘要

在节能方案中,确定深度学习模型的最优规模十分重要且影响广泛。与此同时,近期研究报道了一种意外现象——稀疏双下降:随着模型稀疏度增加,性能先变差、再变好、最终恶化。这种非单调行为对维持高性能所需的最优模型规模提出了严峻疑问:模型需足够过参数化,但参数过多又浪费训练资源。本文旨在高效寻找最佳权衡。更确切地说,我们着手解决稀疏双下降的出现并给出若干规避方案。首先,我们表明简单的2\ell_2正则化方法可缓解该现象,但牺牲了性能/稀疏度折中。为克服此问题,我们随后引入一种以知识蒸馏正则化学生模型的学习方案。基于典型图像分类设置的实验结果支撑,我们表明该方法可避免此类现象。

关键词

引用

@article{arxiv.2308.16596,
  title  = {The Quest of Finding the Antidote to Sparse Double Descent},
  author = {Victor Quétu and Marta Milovanović},
  journal= {arXiv preprint arXiv:2308.16596},
  year   = {2023}
}