中文

LayerPipe2:通过改进指数移动平均实现多层流水线与权重重计算的神经网络训练方法

机器学习 2026-04-21 v1 人工智能 硬件体系结构

摘要

在我们先前的LayerPipe工作中,我们提出了一种通过重叠前向与反向计算来加速卷积神经网络、全连接网络和脉冲神经网络训练的方法。然而,尽管在经验上取得了成功,但尚未从原理上阐明在每一层需要引入多少梯度延迟才能达到期望的流水线化程度。本文LayerPipe2填补了这一空白,通过变量延迟梯度自适应与重定时正式推导了LayerPipe。我们确定了延迟可以合法插入的位置,并表明所需延迟量直接取决于网络结构:内层需要较少延迟,外层需要较长延迟。当每一层都进行流水线化时,延迟量仅取决于剩余的下游阶段数。当以组为单位进行流水线化时,组内所有层共享相同的延迟分配。这些见解不仅解释了此前观察到的调度模式,还揭示了一个常被忽视的挑战——流水线化隐式要求存储历史权重。我们通过开发一种流水线感知的移动平均方法来克服这一存储瓶颈,该方法重建所需的历史状态而非显式存储,从而在不牺牲使流水线化学习可行的精度保证的前提下降低了内存开销。结果是一个系统的框架,说明了如何构建LayerPipe架构、预测其延迟需求并缓解其存储负担,从而实现具有可控通信-计算权衡的可扩展流水线训练。

关键词

引用

@article{arxiv.2512.08160,
  title  = {LayerPipe2: Multistage Pipelining and Weight Recompute via Improved Exponential Moving Average for Training Neural Networks},
  author = {Nanda K. Unnikrishnan and Keshab K. Parhi},
  journal= {arXiv preprint arXiv:2512.08160},
  year   = {2026}
}

备注

Proc. of 2025 Asilomar Conference on Signals, Systems, and Computers, October 2025, Pacific Grove, CA