中文

基于逆尺度空间探索深度网络结构稀疏性

机器学习 2022-04-22 v5 动力系统 最优化与控制 机器学习

摘要

深度神经网络的巨大成功建立在其过参数化之上,后者平滑了优化地形而不损害泛化能力。尽管过参数化有益,海量参数使深度网络在日常应用中笨重。尽管已发展出剪枝与蒸馏等技术,但作为后向选择方法,它们需完整训练稠密网络而代价高昂,且在学习深度网络结构稀疏性的前向选择方法上仍属空白。为填补此空白,本文提出一种基于逆尺度空间微分包含的新方法,其通过耦合一对参数沿动力学生成从简到繁的一族模型,从而可同时探索过参数化深度模型及其结构稀疏性。此类微分包含格式有一种简单离散化,称为深度结构分裂线性化Bregman迭代(DessiLBI),其在Kurdyka-Lojasiewicz框架下可建立学习深度网络的全局收敛性。实验证据表明,我们的方法在基准数据集上探索若干广泛使用的主干网络稀疏结构时,取得了可与竞争优化器媲美甚至更优的性能。值得注意的是,通过早停,我们的方法在早期epoch揭示了“中奖票”:具有与完全训练的过参数化模型相当测试精度的有效稀疏网络结构,并可进一步迁移至类似替代任务。此外,我们的方法能以自适应滤波器配置高效生长网络,以低得多的计算代价展现出良好性能。代码与模型可于{https://github.com/DessiLBI2020/DessiLBI}下载。

关键词

引用

@article{arxiv.1905.09449,
  title  = {Exploring Structural Sparsity of Deep Networks via Inverse Scale Spaces},
  author = {Yanwei Fu and Chen Liu and Donghao Li and Zuyuan Zhong and Xinwei Sun and Jinshan Zeng and Yuan Yao},
  journal= {arXiv preprint arXiv:1905.09449},
  year   = {2022}
}

备注

This is the journal extension version of the ICML conference paper, "DessiLBI: Exploring Structural Sparsity of Deep Networks via Differential Inclusion Paths"