用梯度下降训练两层 ReLU 网络是不一致的
机器学习
2022-06-10 v3 机器学习
摘要
我们证明,由例如 He 等人(2015)提出的广泛使用的方法初始化、并在最小二乘损失上用梯度下降训练的两层(Leaky)ReLU 网络不是普遍一致的。具体而言,我们描述了一大类一维数据生成分布,对于它们,以高概率梯度下降仅找到优化景观的一个糟糕局部极小,因为它无法将偏置从其零初始化处大幅移开。结果表明,在这些情况下,所找到的网络本质上执行线性回归,即使目标函数是非线性的。我们进一步提供数值证据,表明这发生在实际情形的某些多维分布中,且随机梯度下降表现出类似行为。我们还提供关于初始化与优化器的选择如何影响该行为的经验结果。
引用
@article{arxiv.2002.04861,
title = {Training Two-Layer ReLU Networks with Gradient Descent is Inconsistent},
author = {David Holzmüller and Ingo Steinwart},
journal= {arXiv preprint arXiv:2002.04861},
year = {2022}
}
备注
To appear in Journal of Machine Learning Research (JMLR). Changes in v3: Added new Section 10 with extensive experimental evaluation. Code available at https://github.com/dholzmueller/nn_inconsistency