中文

无需微调的平滑模型压缩

机器学习 2025-06-02 v1

摘要

压缩和剪枝大型机器学习模型已成为将其部署于实际应用的关键步骤。标准剪枝和压缩技术通常在设计时未考虑网络权重的结构,从而限制了其有效性。我们探讨了平滑正则化对神经网络训练和模型压缩的影响。通过在训练期间对权重施加核范数及一阶和二阶导数惩罚,我们鼓励结构化平滑,同时保持与非平滑模型相当的预测性能。我们发现,标准剪枝方法应用于这些平滑模型时通常表现更好。基于这一观察,我们应用一种基于奇异值分解(SVD)的压缩方法,该方法利用底层的平滑结构,用较小的低秩张量近似模型的权重张量。我们的方法无需任何微调即可实现SOTA压缩——在CIFAR-10上的平滑ResNet-18上达到高达91%91\%的准确率,且参数减少了70%70\%

关键词

引用

@article{arxiv.2505.24469,
  title  = {Smooth Model Compression without Fine-Tuning},
  author = {Christina Runkel and Natacha Kuete Meli and Jovita Lukasik and Ander Biguri and Carola-Bibiane Schönlieb and Michael Moeller},
  journal= {arXiv preprint arXiv:2505.24469},
  year   = {2025}
}