中文

揭秘ResNet

神经与进化计算 2017-05-23 v2 机器学习 机器学习

摘要

残差网络(ResNet)由He等人(2015)提出,利用快捷连接显著降低了训练难度,从而在训练和泛化误差方面带来巨大性能提升。He等人(2015)经验观察到,堆叠更多具有快捷2的残差块导致更小的训练误差,而对于快捷1或3则不然。我们为快捷2的唯一性提供理论解释。我们表明,无论是否有非线性,通过添加深度为2的快捷连接,零初始点处损失函数Hessian的条件数与深度无关,这使得训练极深模型不比浅层模型更困难。更深度的快捷导致初始时极其平坦(高阶)驻点,优化算法难以逃离。而快捷1本质上等价于无快捷,其条件数随层数增长爆炸至无穷。我们进一步论证,当层数趋于无穷时,仅看零初始点处的损失函数就足够了。我们提供了伴随理论结果的广泛实验。我们表明,将网络初始化为小权重且快捷2,从最终损失、学习动态和稳定性,到学习过程中Hessian的行为等各种角度,均比随机高斯(Xavier)初始化、正交初始化和更深快捷取得显著更好结果。

关键词

引用

@article{arxiv.1611.01186,
  title  = {Demystifying ResNet},
  author = {Sihan Li and Jiantao Jiao and Yanjun Han and Tsachy Weissman},
  journal= {arXiv preprint arXiv:1611.01186},
  year   = {2017}
}