中文

避免反向传播的代价

机器学习 2025-06-30 v1

摘要

前向模式自动微分(FmAD)和零阶(ZO)优化被提出作为反向传播(BP)在梯度计算中内存效率较好的替代方案,尤其在资源受限的环境中。然而,其实际效益仍不清晰,原因在于两个关键缺口:缺乏与内存高效BP变体(如激活检查点)的比较,以及缺乏统一的理论分析。本文提供了BP、FmAD和ZO方法的全面理论与实证比较。我们的理论分析表明,尽管FmAD和ZO可以降低内存使用,但在准确性、收敛速度和计算成本方面都会付出显著代价,与采用检查点的BP相比。这两种方法的缺陷会随着模型规模增大或扰动预算受限而加剧。在大型语言模型和视觉-语言模型上的实验结果显示,采用检查点的BP在相当于相同内存使用下的FMD和ZO变体(包括采用方差缩减增强的变体)中表现出更佳性能,分别实现了最高31.1%的更高准确率、34.8%的更快收敛速度以及3.8倍更少的计算量。我们的实验结果凸显了FmAD和ZO的根本局限,重新确认采用检查点的BP是内存受限环境下模型训练的最有效策略。我们的代码已公开于 https://github.com/Astuary/The_Cost_of_Avoiding_Backpropagation。

关键词

引用

@article{arxiv.2506.21833,
  title  = {The Cost of Avoiding Backpropagation},
  author = {Kunjal Panchal and Sunav Choudhary and Yuriy Brun and Hui Guan},
  journal= {arXiv preprint arXiv:2506.21833},
  year   = {2025}
}