通过反平方根线性单元(ISRLU)改进深度学习
机器学习
2017-11-13 v2
摘要
我们引入“反平方根线性单元”(ISRLU)以加速深度神经网络的学习。ISRLU比ELU性能更好,但具有许多相同优点。ISRLU与ELU具有相似的曲线与特性。两者均具有负值,可使平均单元激活更接近零,并使常规梯度更接近单位自然梯度,确保噪声鲁棒的失活状态,降低过拟合风险。ISRLU在传统CPU上的显著性能优势也延续到CNN/RNN在软硬件协同设计上更高效的硬件实现。在使用TensorFlow的实验中,ISRLU在CNN上比ReLU学习更快且泛化更好。本工作还提出一种计算高效的变体称为“反平方根单元”(ISRU),可用于RNN。许多RNN使用长短期记忆(LSTM)与门控循环单元(GRU),它们由tanh与sigmoid激活函数实现。ISRU计算复杂度更低,但仍有与tanh和sigmoid相似的曲线。
引用
@article{arxiv.1710.09967,
title = {Improving Deep Learning by Inverse Square Root Linear Units (ISRLUs)},
author = {Brad Carlile and Guy Delamarter and Paul Kinney and Akiko Marti and Brian Whitney},
journal= {arXiv preprint arXiv:1710.09967},
year = {2017}
}
备注
8 pages, 2 figures, 5 tables