中文

基于高斯抽样的深度学习模型训练中能源成本的最小化

计算机视觉与模式识别 2024-06-12 v1

摘要

通过反向传播计算 loss gradient 在深度学习 (DL) 模型训练中消耗大量能源。本文提出了一种新方法,有效计算 DL 模型的梯度,以缓解与反向传播相关的巨大能源开销。我们利用 DL 模型的过参数化特性以及其 loss landscape 的光滑性,提出了一种称为 {\em GradSamp} 的方法,用于从高斯分布中抽样梯度更新。具体而言,我们在给定 epoch (可定期或随机选择) 时,通过对先前 epoch 的参数进行元素级扰动(添加高斯噪声)来更新模型参数。该高斯分布的参数通过两个相邻 epoch 之间模型参数值之间的误差来估计。{\em GradSamp} 不仅简化了梯度计算,还能够跳过整个 epoch,从而提高整体效率。我们在多套标准和非标准 CNN 和基于 transformer 的模型上严格验证了我们的假设,这些模型涵盖了各种计算机视觉任务,包括图像分类、目标检测和图像分割。此外,我们探讨了其在域外场景中的有效性,如 Domain Adaptation (DA)、Domain Generalization (DG) 以及类似联邦学习 (FL) 的去中心化设置。我们的实验结果确认了 {\em GradSamp} 在不损害性能的前提下实现显著能源节省的有效性,凸显了其在实际 DL 应用中的通用性和潜在影响。

关键词

引用

@article{arxiv.2406.07332,
  title  = {Minimizing Energy Costs in Deep Learning Model Training: The Gaussian Sampling Approach},
  author = {Challapalli Phanindra Revanth and Sumohana S. Channappayya and C Krishna Mohan},
  journal= {arXiv preprint arXiv:2406.07332},
  year   = {2024}
}