中文

通过数据蒸馏寻找初始化时的稳定子网络

机器学习 2025-04-15 v1

摘要

最近的研究表明,数据蒸馏( Dataset Distillation)即数据总结过程,可用于加速深度学习模型的训练。然而,其对训练动力学,特别是神经网络修剪的影响仍然鲜有探索。在本工作中,我们在迭代大小修剪(inner loop of iterative magnitude pruning)中使用蒸馏数据,以在初始化时产生稀疏、可训练的子网络——即常被称为彩票票(Lottery Tickets)。在使用150倍更少的训练点的情况下,我们的算法与传统彩票票重绞(rewinding)在ResNet-18 & CIFAR-10上的性能相当。前期工作指出,彩票票可以在稠密初始化对SGD噪声稳定时(即跨越不同数据排序的训练收數于相同最小值)被发现。我们扩展了这一发现,表明即使在稠密初始化不稳定的情况下,也可以存在稳定的子网络。在我们的线性模式连接性研究中,我们发现使用蒸馏数据进行修剪会丢弃有助于损失景观锐度的参数。最后,我们表明,通过首先在初始化时生成稳定的稀疏性掩码,可以在传统迭代大小修剪所能实现的稀疏度显著高于的条件下找到彩票票。

关键词

引用

@article{arxiv.2503.17905,
  title  = {Finding Stable Subnetworks at Initialization with Dataset Distillation},
  author = {Luke McDermott and Rahul Parhi},
  journal= {arXiv preprint arXiv:2503.17905},
  year   = {2025}
}