数据集剪枝:通过考察泛化影响缩减训练数据
机器学习
2023-02-28 v2
摘要
深度学习的巨大成功严重依赖于日益增大的训练数据,这付出了巨大计算与基础设施成本的代价。这引出关键问题:是否所有训练数据都贡献于模型性能?每个训练样本或子训练集对模型泛化的影响有多大?如何从整个训练数据中构建最小子集作为代理训练集而不显著牺牲模型性能?为回答这些,我们提出数据集剪枝,一种基于优化的样本选择方法,其可(1)在理论保证下考察移除特定训练样本集对模型泛化能力的影响,(2)构建产生严格约束泛化差距的最小训练数据子集。数据集剪枝的经验观测泛化差距与我们的理论预期高度一致。此外,所提方法在 CIFAR-10 数据集上剪除 40% 训练样本,仅以 1.3% 测试精度下降将收敛时间减半,优于先前基于分数的样本选择方法。
引用
@article{arxiv.2205.09329,
title = {Dataset Pruning: Reducing Training Data by Examining Generalization Influence},
author = {Shuo Yang and Zeke Xie and Hanyu Peng and Min Xu and Mingming Sun and Ping Li},
journal= {arXiv preprint arXiv:2205.09329},
year = {2023}
}