无需激活函数尺度不变性的深度学习快速泛化误差界
机器学习
2019-07-26 v1 机器学习
摘要
在深度学习的理论分析中,发现深度学习的哪些特征导致其良好性能是一项重要任务。本文利用 Suzuki (2018) 提出的泛化误差分析框架,针对具有更一般激活函数的深度神经网络推导出了快速学习率。在 Suzuki (2018) 中,假设激活函数的尺度不变性,推导出了深度学习的紧致泛化误差界。他们提到激活函数的尺度不变性对于推导紧致误差界是至关重要的。虽然修正线性单元(ReLU; Nair and Hinton, 2010)满足尺度不变性,但其他著名的激活函数,包括 sigmoid 函数和双曲正切函数,以及指数线性单元(ELU; Clevert et al., 2016)并不满足该条件。现有分析表明,当使用尺度不变激活的深度学习能够达到快于 的速率时,使用非尺度不变激活的深度学习可能存在 的较慢收敛速率。本文在不假设激活函数尺度不变性的情况下,推导出了与 Suzuki (2018) 基本相同的紧致泛化误差界。由该结果可知,至少在 Suzuki (2018) 的框架下,激活函数的尺度不变性并非获得快速收敛速率的必要条件。同时,这也表明 Suzuki (2018) 提出的理论框架可广泛应用于具有一般激活函数的深度学习分析。
引用
@article{arxiv.1907.10900,
title = {Fast generalization error bound of deep learning without scale invariance of activation functions},
author = {Yoshikazu Terada and Ryoma Hirose},
journal= {arXiv preprint arXiv:1907.10900},
year = {2019}
}
备注
32 pages