中文

通过分数外推实现有效的数据剪枝

机器学习 2025-06-23 v2

摘要

训练先进的机器学习模型需要大规模数据集,导致计算成本高昂。为应对这一挑战,数据剪枝技术识别并移除冗余训练样本,同时保持模型性能。然而,现有剪枝技术主要需要完整的初始训练过程来识别可移除样本,从而抵消了单次训练运行的效率优势。为克服这一限制,我们提出了一种新颖的重要性分数外推框架,该框架仅需在一小部分数据上进行训练。我们在此框架中提出了两种初始方法——k 近邻和图神经网络——以利用从该最小子集中学到的模式准确预测整个数据集的样本重要性。我们在两种最先进的剪枝方法(Dynamic Uncertainty 和 TDDS)、四个不同数据集(CIFAR-10、CIFAR-100、Places-365 和 ImageNet)以及三种训练范式(监督学习、无监督学习和对抗学习)上验证了方法的有效性。结果表明,分数外推是将昂贵分数计算方法(如剪枝、数据归因或其他任务)扩展规模的有前景方向。

关键词

引用

@article{arxiv.2506.09010,
  title  = {Effective Data Pruning through Score Extrapolation},
  author = {Sebastian Schmidt and Prasanga Dhungel and Christoffer Löffler and Björn Nieth and Stephan Günnemann and Leo Schwinn},
  journal= {arXiv preprint arXiv:2506.09010},
  year   = {2025}
}