中文

COMET:一种利用有界误差有损压缩的新型高效内存深度学习训练框架

人工智能 2021-11-19 v1 分布式、并行与集群计算

摘要

训练宽且深的神经网络(DNN)需要大量存储资源(如内存),因为中间激活数据必须在前向传播时保存在内存中,并在反向传播时恢复。然而,由于硬件设计限制,最先进的加速器(如 GPU)仅配备非常有限的内存容量,这在训练大规模 DNN 时严重限制了最大批大小,进而限制了性能加速。传统的内存节省技术要么存在性能开销,要么受限于有限的互连带宽或特定的互连技术。在本文中,我们提出了一种新颖的高效内存 CNN 训练框架(称为 COMET),它利用有界误差有损压缩来显著减少训练所需的内存,从而允许训练更大的模型或加速训练。与采用基于图像的有损压缩器(如 JPEG)压缩激活数据的最先进方案不同,我们的框架特意采用了具有严格误差控制机制的有界误差有损压缩。具体而言,我们对从被改变的激活数据到梯度的压缩误差传播进行了理论分析,并实证研究了被改变梯度对训练过程的影响。基于这些分析,我们优化了有界误差有损压缩,并提出了一种用于激活数据压缩的自适应误差界控制方案。我们使用五种广泛采用的 CNN 和 ImageNet 数据集,针对最先进方案评估了我们的设计。实验表明,与基线训练相比,我们提出的框架可将训练内存消耗显著降低至多 13.5 倍,与另一种最先进的基于压缩的框架相比降低 1.8 倍,且精度损失极小或没有。

关键词

引用

@article{arxiv.2111.09562,
  title  = {COMET: A Novel Memory-Efficient Deep Learning Training Framework by Using Error-Bounded Lossy Compression},
  author = {Sian Jin and Chengming Zhang and Xintong Jiang and Yunhe Feng and Hui Guan and Guanpeng Li and Shuaiwen Leon Song and Dingwen Tao},
  journal= {arXiv preprint arXiv:2111.09562},
  year   = {2021}
}

备注

14 pages, 17 figures, accepted by VLDB 2022. arXiv admin note: substantial text overlap with arXiv:2011.09017