中文

无需激活函数尺度不变性的深度学习快速泛化误差界

机器学习 2019-07-26 v1 机器学习

摘要

在深度学习的理论分析中,发现深度学习的哪些特征导致其良好性能是一项重要任务。本文利用 Suzuki (2018) 提出的泛化误差分析框架,针对具有更一般激活函数的深度神经网络推导出了快速学习率。在 Suzuki (2018) 中,假设激活函数的尺度不变性,推导出了深度学习的紧致泛化误差界。他们提到激活函数的尺度不变性对于推导紧致误差界是至关重要的。虽然修正线性单元(ReLU; Nair and Hinton, 2010)满足尺度不变性,但其他著名的激活函数,包括 sigmoid 函数和双曲正切函数,以及指数线性单元(ELU; Clevert et al., 2016)并不满足该条件。现有分析表明,当使用尺度不变激活的深度学习能够达到快于 O(1/n)O(1/\sqrt{n}) 的速率时,使用非尺度不变激活的深度学习可能存在 O(1/n)O(1/\sqrt{n}) 的较慢收敛速率。本文在不假设激活函数尺度不变性的情况下,推导出了与 Suzuki (2018) 基本相同的紧致泛化误差界。由该结果可知,至少在 Suzuki (2018) 的框架下,激活函数的尺度不变性并非获得快速收敛速率的必要条件。同时,这也表明 Suzuki (2018) 提出的理论框架可广泛应用于具有一般激活函数的深度学习分析。

关键词

引用

@article{arxiv.1907.10900,
  title  = {Fast generalization error bound of deep learning without scale invariance of activation functions},
  author = {Yoshikazu Terada and Ryoma Hirose},
  journal= {arXiv preprint arXiv:1907.10900},
  year   = {2019}
}

备注

32 pages