前馈模型中的稀疏度倾向
机器学习
2024-10-21 v1 人工智能
摘要
训练神经网络以解决任务时,是否倾向于使用所有可用权重,即使该任务可以用更少的权重来解决?为回答此问题,我们研究了在改变模型宽度的情况下,对全连接、卷积和残差模型进行剪枝的效果。我们发现,由于模型大小的变化,能够在不降低性能的情况下剪裁的权重比例基本不变。增加模型宽度对相对于被剪枝网络绝对尺寸增加而言的稀疏度影响不大。特别是,我们在相当大的模型尺寸范围内发现了显著的可剪裁性,其中我们最大的模型是最小模型的 50 倍宽度。我们探讨了解释这些发现的三个假设。
引用
@article{arxiv.2410.14461,
title = {The Propensity for Density in Feed-forward Models},
author = {Nandi Schoots and Alex Jackson and Ali Kholmovaia and Peter McBurney and Murray Shanahan},
journal= {arXiv preprint arXiv:2410.14461},
year = {2024}
}