Flatten-T Swish:一种类 ReLU-Swish 的阈值化深度学习激活函数
神经与进化计算
2018-12-18 v1 机器学习
机器学习
摘要
激活函数对于深度学习方法来学习并执行图像分类等复杂任务至关重要。修正线性单元(Rectified Linear Unit,ReLU)自 2012 年以来已被广泛使用,并成为深度学习领域的默认激活函数。尽管 ReLU 很流行,但其硬零特性严重阻碍了负值在网络中传播,因而深度神经网络未能从负向表示中获益。本文提出一种称为 Flatten-T Swish(FTS)的激活函数,其利用了负值的优势。为验证其性能,本研究将 FTS 与 ReLU 及若干近期激活函数进行比较评估。每种激活函数均在 MNIST 数据集上于五种深度为五至八层的不同深度全连接神经网络(DFNNs)上训练。为公平评估,所有 DFNNs 均采用相同配置设置。基于实验结果,阈值 T=-0.20 的 FTS 具有最佳综合性能。与 ReLU 相比,FTS(T=-0.20)在更宽 5 层、更窄 5 层、6 层、7 层和 8 层 DFNNs 上分别将 MNIST 分类准确率提升了 0.13%、0.70%、0.67%、1.07% 和 1.15%。此外,本研究还注意到 FTS 的收敛速度是 ReLU 的两倍。尽管也评估了其他现有激活函数,本研究仍选取 ReLU 作为基线激活函数。
引用
@article{arxiv.1812.06247,
title = {Flatten-T Swish: a thresholded ReLU-Swish-like activation function for deep learning},
author = {Hock Hung Chieng and Noorhaniza Wahid and Pauline Ong and Sai Raj Kishore Perla},
journal= {arXiv preprint arXiv:1812.06247},
year = {2018}
}