中文

LiSHT:用于神经网络的非参数线性缩放双曲正切激活函数

计算机视觉与模式识别 2023-02-20 v4

摘要

神经网络中的激活函数引入了处理复杂任务所需的非线性。针对深度学习模型已提出若干激活/非线性函数。然而,大多数现有激活函数受限于梯度消失问题以及对大负输入值的未充分利用。本文中,我们通过线性缩放 Tanh 提出一种用于神经网络 (NNs) 的线性缩放双曲正切 (LiSHT)。所提 LiSHT 为非参数且解决了梯度消失问题。我们在不同类型的基准数据集上进行了实验,如向量数据、图像数据与自然语言数据。我们分别使用多层感知机 (MLP)、残差网络 (ResNet) 和长短期记忆 (LSTM) 在数据挖掘、图像分类与推文分类任务上观察到优越性能。在 CIFAR100 数据集上,使用带 LiSHT 的 ResNet 模型相比 Tanh、ReLU、PReLU、LReLU 和 Swish 准确率分别提升 9.48、3.40、3.16、4.26 和 1.17\%。我们还通过损失景观、权重分布与激活图展示了支持所提激活函数的定性结果。

关键词

引用

@article{arxiv.1901.05894,
  title  = {LiSHT: Non-Parametric Linearly Scaled Hyperbolic Tangent Activation Function for Neural Networks},
  author = {Swalpa Kumar Roy and Suvojit Manna and Shiv Ram Dubey and Bidyut Baran Chaudhuri},
  journal= {arXiv preprint arXiv:1901.05894},
  year   = {2023}
}

备注

Accepted in 7th International Conference on Computer Vision and Image Processing (CVIP), 2022