基于近似激活的内存高效网络训练反向传播
机器学习
2019-10-30 v2 机器学习
摘要
训练卷积神经网络模型对内存消耗很大,因为反向传播需要存储所有中间层的激活。这在生产环境中部署极深架构时带来实际顾虑,尤其在模型需要基于更新后的数据集频繁重训练时。本文提出一种新的反向传播实现,通过以可忽略的计算代价和极小的训练性能影响使用近似,显著减少内存占用。该算法复用公共缓冲区临时存储完整激活并精确计算前向传播,同时以显著的内存节省存储每层的近似激活副本,用于反向传播。与在标准反向传播中直接近似激活相比,我们的方法限制了跨层误差的累积,从而允许使用更低精度的近似而不影响训练精度。在 CIFAR-10、CIFAR-100 和 ImageNet 上的实验表明,我们的方法性能接近精确训练,同时以低至 4-bit 精度紧凑存储激活。
引用
@article{arxiv.1901.07988,
title = {Backprop with Approximate Activations for Memory-efficient Network Training},
author = {Ayan Chakrabarti and Benjamin Moseley},
journal= {arXiv preprint arXiv:1901.07988},
year = {2019}
}
备注
Project page at http://projects.ayanc.org/blpa/