通过p范数门控加速极深度网络训练
机器学习
2016-08-15 v1 机器学习
神经与进化计算
摘要
深度神经网络近期进展的一个主要促成因素是让感官信息与梯度易于传播的结构单元。门控正是这样一种充当流控制的结构。门控被用于许多近期最先进的循环模型如LSTM与GRU,以及前馈模型如残差网络(Residual Nets)与高速网络(Highway Networks)。这使得上百层的极深度网络中的学习成为可能,并助力在视觉(如用残差网络的ImageNet)与自然语言处理(如用GRU的机器翻译)中取得破纪录结果。然而,分析门控在学习过程中作用的工作有限。本文提出一种灵活的范数门控方案,其允许可用户控制的流,从而提升学习速度。该方案囊括其他现有门控方案,包括GRU、高速网络与残差网络中的那些,作为特例。在大型序列与向量数据集上的实验表明,所提门控方案在无需额外开销下显著加快学习速度。
引用
@article{arxiv.1608.03639,
title = {Faster Training of Very Deep Networks Via p-Norm Gates},
author = {Trang Pham and Truyen Tran and Dinh Phung and Svetha Venkatesh},
journal= {arXiv preprint arXiv:1608.03639},
year = {2016}
}
备注
To appear in ICPR'16