中文

连续 16 位训练:加速 32 位预训练神经网络

机器学习 2023-12-04 v2 人工智能

摘要

在深度学习领域,最初以 32 位精度训练的模型的普遍性证明了其鲁棒性与准确性。然而,这些模型的持续演进常需要进一步训练,这可能耗费大量资源。本研究引入一种新方法,使用 16 位精度继续训练这些已有的 32 位模型。该技术不仅满足了计算资源效率的需求,还显著提升了额外训练阶段的速度。通过采用 16 位精度进行持续训练,我们得以大幅降低内存需求与计算负担,从而在资源受限环境下加速训练过程。我们的实验表明,该方法在保持原 32 位训练所设立的高准确性标准的同时,提供了亟需的训练速度提升。该方法在当下尤为相关,因为大多数模型最初以 32 位训练并需要周期性更新与精化。我们的研究发现表明,这种 16 位延续训练策略可成为可持续且高效深度学习的关键方案,提供了一种在资源意识下快速增强预训练模型的实用途径。

关键词

引用

@article{arxiv.2311.18587,
  title  = {Continuous 16-bit Training: Accelerating 32-bit Pre-Trained Neural Networks},
  author = {Juyoung Yun},
  journal= {arXiv preprint arXiv:2311.18587},
  year   = {2023}
}

备注

Not Completed Paper