基于Frank-Wolfe动量的投影自由CNN剪枝:更稀疏的模型更少预训练
机器学习
2025-12-02 v1
摘要
我们研究了Frank-Wolfe(FW)优化方法的算法变体,用于卷积神经网络的剪枝。这一工作是以“彩票票 hypothesis”为动机的,该假设暗示较大预训练网络中存在能够表现良好(甚至更好)的较小子网络。虽然该领域的大多数文献更广泛地关注深度神经网络,但我们特别关注用于图像分类的卷积神经网络。基于该假设,我们比较了简单基于幅值的剪枝、一种Frank-Wolfe风格的剪枝方案,以及一种带动量的FW方法,对在MNIST上训练的CNN进行测试。我们的实验在稀疏度、测试准确率、损失和推理时间等指标上进行跟踪,讨论预训练预算从1到10个epoch的变化。我们发现,带动量的FW方法产生的剪枝网络既比原始稠密模型和简单剪枝基线更稀疏,也更准确,同时在我们的实现中造成最小的推理时间开销。此外,带动量的FW方法仅经过少数epoch的预训练即可达到这些准确度,表明在该设置下,稠密模型的完整预训练并非必需。
关键词
引用
@article{arxiv.2512.01147,
title = {Projection-Free CNN Pruning via Frank-Wolfe with Momentum: Sparser Models with Less Pretraining},
author = {Hamza ElMokhtar Shili and Natasha Patnaik and Isabelle Ruble and Kathryn Jarjoura and Daniel Suarez Aguirre},
journal= {arXiv preprint arXiv:2512.01147},
year = {2025}
}
备注
Preliminary preprint; numerical experiments are still being validated and may be updated in future revisions