将 Dropout 理解为一种优化技巧
机器学习
2019-10-10 v3 机器学习
摘要
作为训练深度神经网络的标准方法之一,dropout 已被用于正则化大型模型以避免过拟合,并且 dropout 带来的性能提升被解释为避免了节点之间的共适应。然而,当比较使用或不使用 dropout 训练网络后节点间的相关性时,一个问题随之产生:共适应避免是否能完全解释 dropout 的效果。在本文中,我们提出了 dropout 为何有效的另一种解释,并提出了一种设计更好激活函数的新技术。首先,我们表明 dropout 可以被解释为一种优化技术,通过即使在反向传播中的饱和区域也加速梯度信息流动,将输入推向非线性激活函数的饱和区域。基于这一解释,我们提出了一种激活函数的新技术,即激活函数中的梯度加速(GAAF),它加速梯度即使在饱和区域也能流动。然后,激活函数的输入可以爬升至饱和区域,这使得网络更加鲁棒,因为模型收敛于一个平坦区域。实验结果支持我们对 dropout 的解释,并确认所提出的 GAAF 技术以预期的特性改进了图像分类性能。
引用
@article{arxiv.1806.09783,
title = {Understanding Dropout as an Optimization Trick},
author = {Sangchul Hahn and Heeyoul Choi},
journal= {arXiv preprint arXiv:1806.09783},
year = {2019}
}
备注
16 pages