“数据节食下的深度学习”可复现吗?总体是,但初始化时的 GraNd 不可
机器学习
2023-04-03 v1 计算机视觉与模式识别
摘要
Paul 等人(2021)的论文“Deep Learning on a Data Diet”引入了两种用于神经网络训练过程中数据集剪枝的创新度量。虽然我们能够复现其在第 20 轮训练时 EL2N 分数的结果,但初始化时的 GraNd 分数却无法复现。然而,训练后期的 GraNd 分数提供了有用的剪枝信号。初始化时的 GraNd 分数计算的是在任一训练发生之前,某个输入样本在多个随机初始化模型上的平均梯度范数。我们的分析揭示了初始化时的 GraNd 分数与样本的输入范数之间的强相关性,表明后者本可作为数据剪枝的一个廉价新基线。遗憾的是,初始化时的 GraNd 分数与输入范数在性能上均未超越随机剪枝。这与 Paul 等人(2021)的一项发现相矛盾。我们使用更新版的原始 JAX 仓库以及新实现的 PyTorch 代码库,均未能复现其 CIFAR-10 结果。对 2021 年 underlying JAX/FLAX 代码的调查暴露了一个检查点恢复代码中的 bug,该 bug 已于 2021 年 4 月修复(https://github.com/google/flax/commit/28fbd95500f4bf2f9924d2560062fa50e919b1a5)。
引用
@article{arxiv.2303.14753,
title = {Does "Deep Learning on a Data Diet" reproduce? Overall yes, but GraNd at Initialization does not},
author = {Andreas Kirsch},
journal= {arXiv preprint arXiv:2303.14753},
year = {2023}
}
备注
5 pages