中文

重新思考层冻结在高效 DNN 训练中的潜力

机器学习 2025-08-22 v1

摘要

随着深度神经网络和数据集规模的不断增长,训练的计算成本显著增加。层冻结技术近期作为有效降低网络训练成本的有前景方法引起了广泛关注。然而,在传统的层冻结方法中,冻结层仍需用于前向传播以生成未冻结层的特征图,这限制了计算成本的降低。为克服这一问题,先前的研究提出了一种假设性的解决方案,即缓存冻结层的特征图作为新数据集,使后续层可以直接在存储的特征图上训练。虽然这种方法看似直接,但先验文献严重忽视了几个重大挑战,例如如何对特征图有效应用数据增强以及由此带来的大量存储开销。如果这些被忽视的挑战未得到解决,缓存方法的性能将受到严重影响,甚至变得不可行。本文首次全面探索了这些挑战并提供了系统性的解决方案。为提高训练准确性,我们提出了相似感知的通道增强(similarity-aware channel augmentation),它以最小的额外存储成本缓存对增强敏感的通道。为缓解存储开销,我们将有损数据压缩引入层冻结,并设计了渐进式压缩策略,随着更多层被冻结而逐步提高压缩率,有效降低存储成本。最后,我们的解决方案在保持模型准确性的同时显著降低了训练成本,仅引入少量时间开销。此外,我们对冻结和压缩策略进行了全面评估,为优化其在高效 DNN 训练中的应用提供了见解。

关键词

引用

@article{arxiv.2508.15033,
  title  = {Rethinking the Potential of Layer Freezing for Efficient DNN Training},
  author = {Chence Yang and Ci Zhang and Lei Lu and Qitao Tan and Sheng Li and Ao Li and Xulong Tang and Shaoyi Huang and Jinzhen Wang and Guoming Li and Jundong Li and Xiaoming Zhai and Jin Lu and Geng Yuan},
  journal= {arXiv preprint arXiv:2508.15033},
  year   = {2025}
}