中文

用锐利缩放因子 $\tau$ 稳定深度 ResNet

机器学习 2023-02-01 v5 机器学习

摘要

我们研究用梯度下降训练深度 ResNet 时的稳定性与收敛性。具体而言,我们证明残差块中的参数分支应被一个因子 τ=O(1/L)\tau =O(1/\sqrt{L}) 缩小,以保证前向/反向过程的稳定,其中 LL 为残差块的数量。此外,我们建立了一个反向结果:当 τ>L12+c\tau>L^{-\frac{1}{2}+c} 时(对任意正常数 cc),前向过程是无界的。上述两个结果共同确立了决定深度 ResNet 稳定性的缩放因子的锐利取值。基于该稳定性结果,我们进一步证明:若 ResNet 被适当过参数化,梯度下降能找到全局极小点,这相比先前工作在允许全局收敛的 τ\tau 范围大得多的情况下有显著改进。而且,我们证明收敛速率与深度无关,从理论上论证了 ResNet 相对于普通前馈网络的优势。在实验上,借助这样的因子 τ\tau,可以在无归一化层的情况下训练深度 ResNet。此外,对于带归一化层的 ResNet,加入这样的因子 τ\tau 也能稳定训练,并为深度 ResNet 带来显著的性能提升。

关键词

引用

@article{arxiv.1903.07120,
  title  = {Stabilize Deep ResNet with A Sharp Scaling Factor $\tau$},
  author = {Huishuai Zhang and Da Yu and Mingyang Yi and Wei Chen and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1903.07120},
  year   = {2023}
}

备注

Journal version (Published in Machine Learning Journal), 26 pages