SparseOpt:解决稀疏训练中的归一化引发的梯度偏斜问题
机器学习
2026-05-28 v1
摘要
动态稀疏训练(DST)方法通过保持稀疏性同时动态调整网络拓扑来训练神经网络。尽管降低计算量的潜力巨大,但 DST 方法的收敛速度显著慢于稠密训练,往往需要相当的训练时间才能达到类似的准确率。我们通过分析和实证研究表明,批量归一化(BN)对稀疏训练产生不利影响,并提出 SparseOpt—a 稀疏感知优化器来解决此问题。在 CIFAR-100 和 ImageNet 上的 ResNet 模型实验表明,我们提出的方法在收敛速度和泛化能力方面均表现出一致的改善。我们的工作凸显了当前归一化层在稀疏训练中的局限性,并对 Batch Normalization、稀疏层和 DST 之间相互作用进行了首次的系统性研究,为使 DST 在实践中与稠密训练竞争迈出了重要一步。
引用
@article{arxiv.2605.27541,
title = {SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training},
author = {Mohammed Adnan and Rohan Jain and Tom Jacobs and Ekansh Sharma and Rahul G. Krishnan and Rebekka Burkholz and Yani Ioannou},
journal= {arXiv preprint arXiv:2605.27541},
year = {2026}
}
备注
Accepted International Conference on Machine Learning (ICML) 2026