中文

SparseOpt:解决稀疏训练中的归一化引发的梯度偏斜问题

机器学习 2026-05-28 v1

摘要

动态稀疏训练(DST)方法通过保持稀疏性同时动态调整网络拓扑来训练神经网络。尽管降低计算量的潜力巨大,但 DST 方法的收敛速度显著慢于稠密训练,往往需要相当的训练时间才能达到类似的准确率。我们通过分析和实证研究表明,批量归一化(BN)对稀疏训练产生不利影响,并提出 SparseOpt—a 稀疏感知优化器来解决此问题。在 CIFAR-100 和 ImageNet 上的 ResNet 模型实验表明,我们提出的方法在收敛速度和泛化能力方面均表现出一致的改善。我们的工作凸显了当前归一化层在稀疏训练中的局限性,并对 Batch Normalization、稀疏层和 DST 之间相互作用进行了首次的系统性研究,为使 DST 在实践中与稠密训练竞争迈出了重要一步。

关键词

引用

@article{arxiv.2605.27541,
  title  = {SparseOpt: Addressing Normalization-induced Gradient Skew in Sparse Training},
  author = {Mohammed Adnan and Rohan Jain and Tom Jacobs and Ekansh Sharma and Rahul G. Krishnan and Rebekka Burkholz and Yani Ioannou},
  journal= {arXiv preprint arXiv:2605.27541},
  year   = {2026}
}

备注

Accepted International Conference on Machine Learning (ICML) 2026