多少预训练足以发现一个良好的子网络?
机器学习
2023-08-24 v3 人工智能
机器学习
最优化与控制
摘要
神经网络剪枝可用于在预训练稠密网络架构中发现高效且高性能的子网络。通常它涉及预训练、剪枝和再训练三步过程,由于稠密模型必须完全预训练,该过程计算昂贵。尽管先前工作已通过实验揭示了预训练量与剪枝网络性能之间的关系,但对此类依赖性的理论刻画仍然缺失。旨在从数学上分析剪枝网络表现良好所需的稠密网络预训练量,我们发现了在两层全连接网络上以梯度下降预训练迭代次数的一个简单理论界,超过该界后通过贪心前向选择[61]进行剪枝可得到一个实现良好训练误差的子网络。有趣的是,该阈值被证明与数据集大小呈对数依赖关系,意味着使用更大数据集的实验需要更多预训练,以使通过剪枝获得的子网络表现良好。最后,我们在MNIST上训练的多层感知机上对理论结果进行了实证验证。
引用
@article{arxiv.2108.00259,
title = {How much pre-training is enough to discover a good subnetwork?},
author = {Cameron R. Wolfe and Fangshuo Liao and Qihan Wang and Junhyung Lyle Kim and Anastasios Kyrillidis},
journal= {arXiv preprint arXiv:2108.00259},
year = {2023}
}
备注
29 pages