使用Frank-Wolfe的神经网络压缩感知训练
机器学习
2024-02-15 v2 最优化与控制
摘要
许多现有神经网络剪枝方法依赖重训练或引入强偏置,以在整个训练过程中收敛到稀疏解。第三类范式“压缩感知”训练旨在获得最先进的稠密模型,通过单次稠密训练即对广泛压缩比具有鲁棒性,同时避免重训练。我们提出一个以通用范数约束族与随机Frank-Wolfe(SFW)算法为核心的框架,在鼓励收敛到高性能解的同时,诱导对卷积滤波器剪枝与低秩矩阵分解的鲁棒性。我们的方法能优于现有压缩感知方法,且在低秩矩阵分解情形下,相比基于核范数正则化的方法也显著节省计算资源。我们的发现表明,如Pokutta等人(2020)所建议的动态调整SFW学习率对SFW训练模型的收敛与鲁棒性至关重要,并为此实践建立了理论基础。
引用
@article{arxiv.2205.11921,
title = {Compression-aware Training of Neural Networks using Frank-Wolfe},
author = {Max Zimmer and Christoph Spiegel and Sebastian Pokutta},
journal= {arXiv preprint arXiv:2205.11921},
year = {2024}
}
备注
8 pages, 5 pages references, 14 pages appendix, 8 figures, and 11 tables