基于 Group Lasso 的贪心剪枝在矩阵感知上可证明地泛化
机器学习
2023-06-06 v2 机器学习
摘要
剪枝方案已广泛用于实践中,以降低具有海量参数训练模型的复杂度。事实上,若干实践研究表明,如果对剪枝后的模型用一些基于梯度的更新进行微调,它能很好地泛化到新样本。尽管上述我们称之为剪枝+微调的流程在降低训练模型复杂度上极为成功,但关于此成功背后的理论却知之甚少。在本文中,我们通过在过参数化矩阵感知问题上研究剪枝+微调框架来解决此问题,其中真实值 ,过参数化模型 且 。我们研究均方误差的近似局部极小值,并加上 group Lasso 正则化项的平滑版本 。特别地,我们可证明地表明,将所有 范数低于某显式阈值的列剪枝,得到的解 具有最少列数 ,且在训练损失上接近真实值。此外,在随后的微调阶段,从 初始化的梯度下降以线性速率收敛到其极限。虽然我们的分析提供了关于正则化在剪枝中作用的见解,我们也展示了在无正则化情况下运行梯度下降会导致不适合贪心剪枝的模型,即许多列的 范数可能与最大者相当。据我们所知,我们的结果首次严格揭示了为何贪心剪枝+微调能产生更小且泛化良好的模型。
引用
@article{arxiv.2303.11453,
title = {Greedy Pruning with Group Lasso Provably Generalizes for Matrix Sensing},
author = {Nived Rajaraman and Devvrit and Aryan Mokhtari and Kannan Ramchandran},
journal= {arXiv preprint arXiv:2303.11453},
year = {2023}
}
备注
49 pages, 2 figures