奇妙的权重及其寻法:动态稀疏训练中何处剪枝
机器学习
2023-12-01 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
动态稀疏训练(DST)是一个快速发展的研究领域,旨在通过训练过程中调整拓扑结构来优化神经网络的稀疏初始化。已有研究表明,在特定条件下,DST能够优于稠密模型。该框架的关键组件是剪枝与生长准则,它们在训练过程中被反复应用以调整网络的稀疏连接。尽管生长准则对DST性能的影响已有相对充分的研究,剪枝准则的影响仍被忽视。为解决此问题,我们设计并对多种剪枝准则进行了广泛的实证分析,以更好地理解其对DST解动力学的影响。令人惊讶的是,我们发现大多数所研究方法产生相似结果。差异在低密度区制下变得更加显著,其中最佳性能主要由最简单技术给出:基于幅值的剪枝。代码见 https://github.com/alooow/fantastic_weights_paper
引用
@article{arxiv.2306.12230,
title = {Fantastic Weights and How to Find Them: Where to Prune in Dynamic Sparse Training},
author = {Aleksandra I. Nowak and Bram Grooten and Decebal Constantin Mocanu and Jacek Tabor},
journal= {arXiv preprint arXiv:2306.12230},
year = {2023}
}
备注
NeurIPS 2023