学习激活函数:理解神经网络的新范式
机器学习
2020-12-10 v3 计算机视觉与模式识别
机器学习
摘要
激活函数领域的研究范围仍然有限,且集中于改善神经网络(NNs)的优化便利性或泛化质量。然而,为深入理解深度学习,更仔细地审视 NN 的非线性组件变得重要。本文旨在提供激活函数的通用形式及相应的数学基础,以便未来对 NN 的工作机制获得洞察。我们提出“可自学激活函数”(SLAF),其在训练过程中被学习,并能够逼近大多数现有激活函数。SLAF 表示为预定义基元素的加权和,可用于对最优激活函数的良好逼近。这些基元素的系数允许在连续函数全体空间(包含所有常规激活)中进行搜索。我们提出了多种可用于配备 SLAF 的神经网络(SLNNs)实现性能的训练例程。我们证明 SLNNs 可以以任意误差逼近任何具有 Lipschitz 连续激活的神经网络,突出了其容量及与标准 NNs 的可能等价性。此外,SLNNs 可完全表示为有限次多项式的集合直至最后一层,从而免除了宽度和深度等多个超参数。由于 SLNNs 的优化仍具挑战,我们展示将 SLAF 与标准激活(如 ReLU)结合使用可带来性能提升,仅少量增加参数数量。
引用
@article{arxiv.1906.09529,
title = {Learning Activation Functions: A new paradigm for understanding Neural Networks},
author = {Mohit Goyal and Rajan Goyal and Brejesh Lall},
journal= {arXiv preprint arXiv:1906.09529},
year = {2020}
}
备注
A modified version of the article has been published in IEEE WCCI 2020