[可复现性报告] Rigging the Lottery:使所有票都成为赢家
机器学习
2021-03-31 v2 计算机视觉与模式识别
摘要
是一种稀疏训练算法,声称在固定参数量和计算预算下,直接训练稀疏网络,其性能匹配或超过现有的稠密到稀疏训练技术(如剪枝)。我们用 Pytorch 从零实现 ,并在 CIFAR-10 上将其性能复现至与报告值相差 0.1% 以内。在 CIFAR-10/100 上,核心主张成立——给定固定训练预算, 在一系列目标稀疏度上超越现有的动态稀疏训练方法。通过更长时间训练,其性能可匹配或超过迭代剪枝,同时在训练全程消耗恒定 FLOPs。我们还表明,针对每个稀疏度、初始化组合调整 超参数几乎无益处——参考超参数选择常接近最优性能。超越原论文,我们发现最优初始化方案取决于训练约束。虽然 Erdos-Renyi-Kernel 分布在固定参数量下优于 Uniform 分布,但在固定 FLOP 量下,后者表现更好。最后,在训练期间重新分配逐层稀疏度可弥合两种初始化方案间的性能差距,但会增加计算成本。
引用
@article{arxiv.2103.15767,
title = {[Reproducibility Report] Rigging the Lottery: Making All Tickets Winners},
author = {Varun Sundar and Rajat Vadiraj Dwaraknath},
journal= {arXiv preprint arXiv:2103.15767},
year = {2021}
}
备注
Under review at ML Reproducibility Challenge 2020. Code available at https://github.com/varun19299/rigl-reproducibility. Training plots and other logs available at https://wandb.ai/ml-reprod-2020