分层神经网络中的隐单元特化:ReLU 与 Sigmoidal 激活对比
机器学习
2020-11-13 v2 无序系统与神经网络
机器学习
摘要
我们在一个面向随机训练过程的建模框架中研究由整流线性单元(ReLU)构成的分层神经网络。与 sigmoidal 激活函数的对比是关注的核心。我们计算了在匹配师生场景下具有 K 个隐单元的浅层网络的典型学习曲线。这些系统在训练集达到临界规模时,通过隐单元特化过程表现出泛化性能的突变。令人惊讶的是,我们的结果表明,ReLU 网络的训练行为与采用 sigmoidal 激活的网络存在质的差异。在具有 K >= 3 个 sigmoidal 隐单元的网络中,该转变是不连续的:特化的网络配置与性能不佳的状态共存并相互竞争,即使对于非常大的训练集也是如此。相反,采用 ReLU 激活则使得所有 K 值下的转变都是连续的:对于足够大的训练集,两种相互竞争、不同特化的状态展现出相似的泛化能力,而在大规模网络下,当 K 趋于无穷时,这两种能力恰好重合。
引用
@article{arxiv.1910.07476,
title = {Hidden Unit Specialization in Layered Neural Networks: ReLU vs. Sigmoidal Activation},
author = {Elisa Oostwal and Michiel Straat and Michael Biehl},
journal= {arXiv preprint arXiv:1910.07476},
year = {2020}
}
备注
Main changes compared to first version: Added a section on supporting Monte Carlo simulations, results and additional figures are presented and discussed. Some references added. Layout changed to single column layout for better readability. Minor textual changes and typos corrected