中文

数据节食下的深度学习:在训练早期找出重要样本

机器学习 2023-03-29 v2

摘要

深度学习近期的成功部分源于在越来越大的数据集上训练日益过参数化的网络。因此自然会问:有多少数据是多余的,哪些样本对泛化重要,以及我们如何找到它们?在这项工作中,我们做出了一个引人注目的观察:在标准视觉数据集中,对若干权重初始化取平均的简单分数可用于在训练非常早期识别重要样本。我们提出了两个这样的分数——梯度范数(GraNd)和误差 L2 范数(EL2N)分数——并通过在一系列架构和数据集上剪枝掉训练数据的显著比例而不牺牲测试精度,证明了它们的有效性。事实上,使用训练几个周期后计算的 EL2N 分数,我们可以剪枝掉一半的 CIFAR10 训练集,同时略微提升测试精度。此外,对于给定的数据集,来自一种架构或超参数配置的 EL2N 分数可泛化到其他配置。与近期通过丢弃训练过程中很少被遗忘的样本来剪枝数据的工作相比,我们的分数仅使用训练早期的局部信息。我们还用我们的分数检测含噪样本,并通过重要样本的视角研究训练动态——我们探究数据分布如何塑造损失曲面,并识别模型数据表示中在训练过程中相对稳定的子空间。

关键词

引用

@article{arxiv.2107.07075,
  title  = {Deep Learning on a Data Diet: Finding Important Examples Early in Training},
  author = {Mansheej Paul and Surya Ganguli and Gintare Karolina Dziugaite},
  journal= {arXiv preprint arXiv:2107.07075},
  year   = {2023}
}

备注

21 pages, 18 figures