用锐利缩放因子 $\tau$ 稳定深度 ResNet
机器学习
2023-02-01 v5 机器学习
摘要
我们研究用梯度下降训练深度 ResNet 时的稳定性与收敛性。具体而言,我们证明残差块中的参数分支应被一个因子 缩小,以保证前向/反向过程的稳定,其中 为残差块的数量。此外,我们建立了一个反向结果:当 时(对任意正常数 ),前向过程是无界的。上述两个结果共同确立了决定深度 ResNet 稳定性的缩放因子的锐利取值。基于该稳定性结果,我们进一步证明:若 ResNet 被适当过参数化,梯度下降能找到全局极小点,这相比先前工作在允许全局收敛的 范围大得多的情况下有显著改进。而且,我们证明收敛速率与深度无关,从理论上论证了 ResNet 相对于普通前馈网络的优势。在实验上,借助这样的因子 ,可以在无归一化层的情况下训练深度 ResNet。此外,对于带归一化层的 ResNet,加入这样的因子 也能稳定训练,并为深度 ResNet 带来显著的性能提升。
引用
@article{arxiv.1903.07120,
title = {Stabilize Deep ResNet with A Sharp Scaling Factor $\tau$},
author = {Huishuai Zhang and Da Yu and Mingyang Yi and Wei Chen and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1903.07120},
year = {2023}
}
备注
Journal version (Published in Machine Learning Journal), 26 pages