中文

DessiLBI:通过微分包含路径探索深度网络的结构稀疏性

计算机视觉与模式识别 2022-04-22 v1 机器学习 动力系统 应用统计 机器学习

摘要

在当今训练神经网络时,过参数化无处不在,它既有利于寻找全局最优解的优化,也有利于降低预测误差的泛化。然而,在许多实际应用场景中需要压缩网络,而直接训练小网络可能陷入局部最优。本文中,我们不是对过参数化模型进行剪枝或蒸馏以得到压缩模型,而是提出了一种基于逆尺度空间微分包含的新方法。具体而言,它生成一系列从简单到复杂的模型,将一对参数耦合起来,以同时训练过参数化的深度模型以及全连接层和卷积层权重上的结构稀疏性。这种微分包含方案有一个简单的离散化形式,我们提出称为深度结构分裂线性化 Bregman 迭代(DessiLBI),并建立了其在深度学习中的全局收敛性分析:从任意初始化出发,算法迭代收敛到经验风险的一个临界点。实验证据表明,在探索多个广泛使用的骨干网络在基准数据集上的结构稀疏性方面,DessiLBI 取得了可与竞争性优化器相媲美甚至更优的性能。值得注意的是,通过早停,DessiLBI 在训练早期揭示了“中奖彩票”:即具有与完全训练的过参数化模型相当测试精度的有效稀疏结构。

关键词

引用

@article{arxiv.2007.02010,
  title  = {DessiLBI: Exploring Structural Sparsity of Deep Networks via Differential Inclusion Paths},
  author = {Yanwei Fu and Chen Liu and Donghao Li and Xinwei Sun and Jinshan Zeng and Yuan Yao},
  journal= {arXiv preprint arXiv:2007.02010},
  year   = {2022}
}

备注

conference , 23 pages https://github.com/corwinliu9669/dS2LBI. arXiv admin note: text overlap with arXiv:1905.09449