数据剪枝中的知识蒸馏
计算机视觉与模式识别
2024-08-15 v2 机器学习
摘要
随着用于训练神经网络的数据集规模不断增加,数据剪枝成为一个有吸引力的研究领域。然而,与在全量数据上训练的模型相比,当前大多数数据剪枝算法在保持准确率方面的能力有限,尤其是在高剪枝率的情况下。在本文中,我们探索了在剪枝子集上训练时结合知识蒸馏(KD)的数据剪枝应用。也就是说,我们不仅依赖真实标签,还使用在完整数据上预训练的教师网络提供的软预测。通过将KD集成到训练中,我们证明了在数据集、剪枝方法以及所有剪枝比例上均有显著改进。我们首先为采用自蒸馏来改善剪枝数据上的训练建立了理论动机。然后,我们通过实验得出一个令人信服且极具实用价值的观察结果:使用KD,简单的随机剪枝在所有剪枝率下都可比肩或优于复杂的剪枝方法。例如,在ImageNet上,尽管仅在50%的随机数据子集上训练,我们仍取得了更优的准确率。此外,我们证明了剪枝因子与最优知识蒸馏权重之间的关键联系。这有助于减轻典型剪枝算法所保留的带有噪声标签和低质量图像的样本的影响。最后,我们得出一个有趣的观察:当使用较低的剪枝比例时,较大的教师模型会导致精度下降,而令人惊讶的是,采用容量小于学生模型的教师模型可能会改善结果。我们的代码将公开。
引用
@article{arxiv.2403.07854,
title = {Distilling the Knowledge in Data Pruning},
author = {Emanuel Ben-Baruch and Adam Botach and Igor Kviatkovsky and Manoj Aggarwal and Gérard Medioni},
journal= {arXiv preprint arXiv:2403.07854},
year = {2024}
}