DSD$^2$:我们能否避开稀疏双下降并无忧压缩神经网络?
机器学习
2024-02-09 v3
摘要
近期工作表明,现代深度学习模型会展现稀疏双下降现象。事实上,随着模型稀疏度增加,测试性能先因模型过拟合训练数据而变差;随后过拟合减轻带来性能提升;最终模型开始遗忘关键信息导致欠拟合。这种行为阻碍了传统早停准则的使用。本工作有三方面关键贡献。第一,我们提出一种避免该现象并提升泛化能力的学习框架。第二,我们引入一种熵度量,可更深入揭示该现象的起因,并使传统停止准则得以使用。第三,我们对重初始化方法、模型宽度与深度、数据集噪声等偶然因素提供了全面的定量分析。上述贡献在典型设定下得到经验证据支持。我们的代码见 https://github.com/VGCQ/DSD2。
引用
@article{arxiv.2303.01213,
title = {DSD$^2$: Can We Dodge Sparse Double Descent and Compress the Neural Network Worry-Free?},
author = {Victor Quétu and Enzo Tartaglione},
journal= {arXiv preprint arXiv:2303.01213},
year = {2024}
}