嵌套前向自动微分以实现内存高效的深度神经网络训练
机器学习
2022-09-23 v1
摘要
激活函数是一种逐元素数学函数,在深度神经网络(DNN)中起着关键作用。许多新颖且复杂的激活函数被提出以提高 DNN 精度,但在反向传播的训练过程中也消耗大量内存。在本研究中,我们提出嵌套前向自动微分(Forward-AD),专门用于逐元素激活函数以实现内存高效的 DNN 训练。我们在两个广泛使用的深度学习框架 TensorFlow 和 PyTorch 中部署嵌套 Forward-AD,它们分别支持静态和动态计算图。我们的评估表明,嵌套 Forward-AD 比基线模型减少高达 1.97 倍的内存占用,并在相同内存缩减比下比重计算(recomputation)性能高出 20%。
引用
@article{arxiv.2209.10778,
title = {Nesting Forward Automatic Differentiation for Memory-Efficient Deep Neural Network Training},
author = {Cong Guo and Yuxian Qiu and Jingwen Leng and Chen Zhang and Ying Cao and Quanlu Zhang and Yunxin Liu and Fan Yang and Minyi Guo},
journal= {arXiv preprint arXiv:2209.10778},
year = {2022}
}
备注
8 pages, ICCD 2022