中文

堆叠作为加速梯度下降

机器学习 2025-02-20 v2 机器学习

摘要

堆叠是一种启发式技术,通过逐步增加层数并通过复制旧层参数来初始化新层,从而训练深度残差网络,已被证明能有效提高深度神经网络的训练效率。本文提出了对堆叠有效性的理论解释:即堆叠实现了一种形式的 Nesterov 加速梯度下降。该理论还涵盖了提升方法中构建的加法集成等更简单的模型,并为提升每轮中初始化新分类器的类似广泛使用的实用启发式方法提供了解释。我们还证明,对于某些深度线性残差网络,堆叠确实提供了加速训练,这是通过对允许更新误差的 Nesterov 加速梯度法进行新的势函数分析得出的。我们还进行了概念验证实验以验证我们的理论。

关键词

引用

@article{arxiv.2403.04978,
  title  = {Stacking as Accelerated Gradient Descent},
  author = {Naman Agarwal and Pranjal Awasthi and Satyen Kale and Eric Zhao},
  journal= {arXiv preprint arXiv:2403.04978},
  year   = {2025}
}