是时候 Swish 了吗?跨 NLP 任务比较深度学习激活函数
计算与语言
2019-01-10 v1 机器学习
神经与进化计算
摘要
激活函数在神经网络中起着关键作用,因为它们是被归因于深度学习成功故事的非线性。目前最流行的激活函数之一是 ReLU,但最近已有若干竞争者被提出或“发现”,包括 LReLU 函数和 swish。虽然大多数工作仅在少数任务(通常来自图像分类)上并与少数竞争者(通常是 ReLU)比较新提出的激活函数,我们进行了首项针对 21 种激活函数在八种不同 NLP 任务上的大规模比较。我们发现一个鲜为人知的激活函数——所谓惩罚型 tanh(penalized tanh)函数——在所有任务上表现最为稳定。我们还表明它能成功替换 LSTM 单元中的 sigmoid 与 tanh 门,在一项具有挑战性的 NLP 任务上带来比标准选择高 2 个百分点(pp)的提升。
引用
@article{arxiv.1901.02671,
title = {Is it Time to Swish? Comparing Deep Learning Activation Functions Across NLP tasks},
author = {Steffen Eger and Paul Youssef and Iryna Gurevych},
journal= {arXiv preprint arXiv:1901.02671},
year = {2019}
}
备注
Published at EMNLP 2018