中文

基于预定稀疏反向传播的面向卷积神经网络的能源高效训练方法ssProp

机器学习 2024-12-31 v2 人工智能

摘要

最近,深度学习在生成式建模方面取得了显著进展,如大型语言模型和概率扩散模型。然而,这些模型的训练往往需要巨大的计算资源,需数十亿吉 FLOP,导致高能耗和较大的碳足迹,引发严峻的环境问题。反向传播(BP)是深度学习模型训练过程中计算成本的主要来源。为推动能源高效训练研究并实现在任何机器和设备上的稀疏学习,本文提出一种可无缝集成到任何深度学习架构中的通用、能源高效的卷积模块。具体而言,本文在反向传播中引入基于通道的稀疏性和额外的梯度选择调度器,基于BP往往稠密且效率低下的假设,这可能导致过拟合和高计算消耗。我们的实验表明,该方法在图像分类和生成任务上可减少40%的计算量,同时可能提升模型性能。这种减少可以为大规模AI系统的研发阶段带来显著的能源节省和碳足迹降低。此外,本方法以与Dropout不同于过拟合的方式,使其可以与Dropout结合以进一步提升模型性能并减少计算资源使用。广泛的实验验证了本方法在各种数据集和任务上的通用性,并与各种深度学习架构和模块兼容。代码已公开available at https://github.com/lujiazho/ssProp。

关键词

引用

@article{arxiv.2408.12561,
  title  = {ssProp: Energy-Efficient Training for Convolutional Neural Networks with Scheduled Sparse Back Propagation},
  author = {Lujia Zhong and Shuo Huang and Yonggang Shi},
  journal= {arXiv preprint arXiv:2408.12561},
  year   = {2024}
}

备注

Accepted by AAAI24 Workshop: Scalable and Efficient Artificial Intelligence Systems