激活函数对过参数化神经网络训练的影响
机器学习
2020-04-13 v4 机器学习
摘要
众所周知,使用基于梯度的方法训练的过参数化神经网络在适当的超参数设置下能快速达到较小的训练误差。最近的论文在合理假设下从理论上证明了这一结论对高度过参数化的网络成立。这些结果要么假设激活函数为 ReLU,要么关键依赖于依赖于数据、随机初始化和激活函数的某个 Gram 矩阵的最小特征值。在后一种情况下,现有工作仅证明该最小特征值为非零,并未给出定量界。在经验方面,近期一系列研究提出了若干替代激活函数,它们至少在某些设置下倾向于比 ReLU 表现更好,但尚未形成清晰的认识。这种状况凸显了从理论上理解激活函数对训练影响的重要性。在本文中,我们给出了关于激活函数对高度过参数化两层神经网络训练影响的理论结果。决定激活性能的一个关键性质是它是否光滑。对于诸如 ReLU、SELU 和 ELU 的非光滑激活,在关于数据的极小假设下,相关 Gram 矩阵的所有特征值都很大。对于诸如 tanh、swish 和多项式的光滑激活,情况更为复杂。如果数据所张成的子空间维数较小,则 Gram 矩阵的最小特征值可能很小,导致训练缓慢。但如果维数较大且数据满足另一温和条件,则特征值很大。如果我们允许深层网络,那么只要深度足够,小的数据维数便不是限制。我们讨论了这些结果的若干推广与应用。
引用
@article{arxiv.1908.05660,
title = {Effect of Activation Functions on the Training of Overparametrized Neural Nets},
author = {Abhishek Panigrahi and Abhishek Shetty and Navin Goyal},
journal= {arXiv preprint arXiv:1908.05660},
year = {2020}
}
备注
Major update: Several new results, some reorganization and rewriting of previous results, new references