没有免费的剪枝:初始化时剪枝的信息论障碍
机器学习
2024-07-26 v2 机器学习
摘要
在初始化时或附近存在“彩票票”这一现象提出了一个诱人的问题:在深度学习中,大型模型是否是必需的,或者是否可以在不训练包含它们的稠密模型的情况下,快速识别并训练稀疏网络。然而,在不训练稠密模型的情况下找到这些稀疏子网络(“初始化时剪枝”)的努力普遍未能成功。我们基于模型的有效参数数量 对此提出了一个理论解释, 由最终网络中非零权重的数量与稀疏掩码和数据之间的互信息之和给出。我们表明,arXiv:2105.12806 中的鲁棒性定律可以扩展到稀疏网络,只需将通常的参数数量替换为 ,这意味着一个能鲁棒地插值噪声数据的稀疏神经网络需要一个高度依赖于数据的掩码。我们假设,训练期间和训练后的剪枝输出的掩码比初始化时剪枝产生的掩码具有更高的互信息。因此,两个网络可能具有相同的稀疏度,但根据其训练方式的不同,其有效参数数量也不同。这表明在初始化附近进行剪枝可能是不可行的,并解释了为什么彩票票存在,但不能被快速找到(即不训练完整网络)。在神经网络上的实验证实,训练过程中获得的信息确实可能影响模型容量。
引用
@article{arxiv.2402.01089,
title = {No Free Prune: Information-Theoretic Barriers to Pruning at Initialization},
author = {Tanishq Kumar and Kevin Luo and Mark Sellke},
journal= {arXiv preprint arXiv:2402.01089},
year = {2024}
}