用于稀疏神经网络的 Bregman 学习框架
机器学习
2022-08-16 v3 数值分析
数值分析
最优化与控制
摘要
我们提出了一种基于随机 Bregman 迭代(也称为镜像下降)的学习框架,以逆尺度空间方法训练稀疏神经网络。我们推导了一个称为 LinBreg 的基线算法、一个使用动量的加速版本,以及 AdaBreg——即 Adam 算法的 Bregman 化推广。与既有的稀疏训练方法不同,我们所提算法族构成了一种纯粹基于优化而无额外启发式的神经网络再生策略。我们的 Bregman 学习框架以极少的初始参数开始训练,逐步仅添加显著参数以获得稀疏且具表现力的网络。所提方法极其简单高效,却得到逆尺度空间方法丰富数学理论的支持。我们推导了统计上严谨的稀疏参数初始化策略,并提供了损失衰减的严格随机收敛分析以及凸情形下的额外收敛证明。仅使用 ResNet-18 参数的 3.4%,我们在 CIFAR-10 上达到了 90.2% 的测试准确率,而稠密网络为 93.6%。我们的算法还揭示了一种用于去噪任务的自动编码器架构。所提框架在集成稀疏反向传播和资源友好型训练方面也具有巨大潜力。
引用
@article{arxiv.2105.04319,
title = {A Bregman Learning Framework for Sparse Neural Networks},
author = {Leon Bungert and Tim Roith and Daniel Tenbrinck and Martin Burger},
journal= {arXiv preprint arXiv:2105.04319},
year = {2022}
}
备注
43 pages, 5 figures, some minor modifications, weakened assumptions