超越神经缩放定律:通过数据剪枝打破幂律缩放
机器学习
2023-04-25 v6 人工智能
计算机视觉与模式识别
机器学习
摘要
被广泛观察到的神经缩放定律中,误差随训练集规模、模型规模或两者之幂次而下降,已推动了深度学习的实质性性能提升。然而,仅靠缩放实现的这些改进在计算与能源上代价高昂。本文聚焦于误差随数据集规模的缩放,并从理论上表明,若我们拥有一种高质量的数据剪枝度量,能够对任意剪枝后的数据集规模排序训练样本应被丢弃的次序,便可突破幂律缩放,甚至有望将其改善为指数缩放。随后,我们以剪枝后的数据集规模对这一改进缩放预测进行实证检验,并在 CIFAR-10、SVHN 与 ImageNet 上训练的 ResNet 中确实观察到优于幂律缩放的实际情况。接着,鉴于寻找高质量剪枝度量的重要性,我们在 ImageNet 上首次对十种不同数据剪枝度量进行了大规模基准测试。我们发现现有多数高性能度量在 ImageNet 上扩展性差,而最佳者计算密集且需每张图像的标签。因此我们提出了一种新颖、廉价且可扩展的自监督剪枝度量,其表现出与最佳有监督度量相当的性能。总体而言,我们的工作表明,发现优良的数据剪枝度量或可为显著改进神经缩放定律提供可行路径,从而降低现代深度学习的资源成本。
引用
@article{arxiv.2206.14486,
title = {Beyond neural scaling laws: beating power law scaling via data pruning},
author = {Ben Sorscher and Robert Geirhos and Shashank Shekhar and Surya Ganguli and Ari S. Morcos},
journal= {arXiv preprint arXiv:2206.14486},
year = {2023}
}
备注
Outstanding Paper Award @ NeurIPS 2022. Added github link to metric scores