ADA-GP:通过自适应梯度预测加速 DNN 训练
机器学习
2023-12-01 v2 人工智能
摘要
神经网络训练本质上是顺序的:各层依次完成前向传播,随后基于损失函数从最后一层开始计算并反向传播梯度。这种顺序计算显著拖慢了神经网络训练,尤其是较深的网络。预测已在计算机体系结构诸多领域成功用于加速顺序处理。因此,我们提出 ADA-GP,其自适应地使用梯度预测来加速深度神经网络(DNN)训练,同时保持精度。ADA-GP 通过引入一个小型神经网络来预测 DNN 模型各层的梯度。ADA-GP 使用一种新颖的张量重组方法,使预测大量梯度成为可能。ADA-GP 在基于反向传播梯度的 DNN 训练与基于预测梯度的 DNN 训练之间交替。ADA-GP 自适应地调整使用梯度预测的时机与时长,以在精度与性能间取得平衡。最后同样重要的是,我们在典型 DNN 加速器中给出了详细的硬件扩展,以实现梯度预测带来的加速潜力。我们对十五个 DNN 模型的广泛实验表明,ADA-GP 可实现平均 1.47 倍的加速,且精度与基线模型相似甚至更高。此外,由于减少了片外存储器访问,其平均能耗比基线加速器低 34%。
引用
@article{arxiv.2305.13236,
title = {ADA-GP: Accelerating DNN Training By Adaptive Gradient Prediction},
author = {Vahid Janfaza and Shantanu Mandal and Farabi Mahmud and Abdullah Muzahid},
journal= {arXiv preprint arXiv:2305.13236},
year = {2023}
}
备注
13 pages, 21 figures, 5 tables