利用幂线性单元(PoLU)训练神经网络
机器学习
2018-02-02 v1
摘要
在本文中,我们提出了“幂线性单元”(PoLU),它增加了神经网络的非线性容量,从而有助于提升其性能。PoLU 吸收了先前提出的激活函数的若干优点。首先,PoLU 对正输入的输出被设计为恒等映射,以避免梯度消失问题。其次,PoLU 对负输入具有非零输出,使得各单元的输出均值接近零,从而减少偏置偏移效应。第三,PoLU 的负半部分存在饱和,使其对负输入更具噪声鲁棒性。此外,我们证明 PoLU 能够通过幂函数将每一层输入的更多部分映射到同一空间,从而增加神经网络的响应区域数量。我们使用图像分类将我们提出的激活函数与其他激活函数进行比较。在实验中,MNIST、CIFAR-10、CIFAR-100、Street View House Numbers (SVHN) 和 ImageNet 被用作基准数据集。我们实现的神经网络包括广泛使用的 ELU-Network、ResNet-50 和 VGG16,以及几个浅层网络。实验结果表明,我们提出的激活函数在大多数网络上优于其他 SOTA 模型。
引用
@article{arxiv.1802.00212,
title = {Training Neural Networks by Using Power Linear Units (PoLUs)},
author = {Yikang Li and Pak Lun Kevin Ding and Baoxin Li},
journal= {arXiv preprint arXiv:1802.00212},
year = {2018}
}