中文

使 ℓ1 正则化在训练稀疏 CNN 中有效

机器学习 2021-10-06 v5 机器学习

摘要

使用 ℓ1 正则化的压缩感知在许多应用中是最强大且流行的稀疏化技术之一,但为何尚未被用于获得如卷积神经网络(CNN)这样的稀疏深度学习模型?本文旨在回答这一问题并展示如何使其奏效。我们首先证明常用的随机梯度下降(SGD)及其变体训练算法与 ℓ1 正则化并不适配,随后将其替换为基于正则化对偶平均(RDA)方法的不同训练算法。RDA 最初专为凸问题设计,但借助新的理论见解与算法修正(采用恰当的初始化与自适应),我们使其与 ℓ1 正则化有效匹配,相较于其他权重剪枝方法在精度不受影响的前提下实现了 CNN 的业界最优稀疏度(例如在 CIFAR-10 上使 ResNet18 达到 95% 稀疏度)。

关键词

引用

@article{arxiv.1807.04222,
  title  = {Make $\ell_1$ Regularization Effective in Training Sparse CNN},
  author = {Juncai He and Xiaodong Jia and Jinchao Xu and Lian Zhang and Liang Zhao},
  journal= {arXiv preprint arXiv:1807.04222},
  year   = {2021}
}

备注

21 pages