神经网络的最优深度
机器学习
2025-06-23 v1 最优化与控制
摘要
确定神经网络的最优深度是一个基础且富有挑战性的问题,通常通过耗时的实验来解决。本文提出了一个形式化的理论框架来回应此问题,通过将深层网络(具体为残差网络ResNet)的正向传递重新表述为最优停止问题。我们将各层隐藏表示的逐层演化建模为序列决策过程,在每一层,必须在停止计算以作出预测,或继续前往更深的层以获得更精细的表示之间做出选择。这种表述捕捉了准确率与计算成本之间的内在权衡。我们的主要理论贡献是,在残差函数的收益递减条件合理的前提下,证明了预期最优停止深度在无限视角下仍然是有限的。我们利用这一洞见提出了一种新颖且实用的正则化项 ,鼓励网络学习适合高效早期退出的表示。我们通过将其扩展到Transformer架构并探索其与连续深度模型通过自由边界问题的联系来展示框架的普适性。在ImageNet上的实验验证表明,我们的正则化器成功地诱导了理论上预测的行为,使计算效率显著提升,而不会损害最终模型准确率,甚至在某些情况下提高准确率。
引用
@article{arxiv.2506.16862,
title = {Optimal Depth of Neural Networks},
author = {Qian Qi},
journal= {arXiv preprint arXiv:2506.16862},
year = {2025}
}