随机特征在理解神经网络中的能力与局限
机器学习
2022-03-01 v4 神经与进化计算
机器学习
摘要
近来,大量论文为训练过参数化神经网络(网络规模大于实现低误差所需)提供了积极的理论结果。关键见解是,在充分过参数化下,基于梯度的方法会隐式地使网络的某些分量相对不变,因此优化动力学将表现得如同这些分量本质上固定在其初始随机值。事实上,显式固定这些分量引出了众所周知的随机特征学习方法。换言之,这些技术意味着,只要能用随机特征成功学习,我们就能用神经网络成功学习。在本文中,我们首先回顾这些技术,为一隐层网络提供简单且自包含的分析。然后我们论证,尽管有令人印象深刻的积极结果,随机特征方法在所能解释的内容上也有固有局限。特别地,我们严格证明,除非网络规模(或权重大小)呈指数级大,否则随机特征无法用于学习即便是单个具有标准高斯输入的 ReLU 神经元。由于单个神经元可用基于梯度的方法学习,我们得出结论:我们离对神经网络经验成功的令人满意的一般性解释仍相距甚远。
引用
@article{arxiv.1904.00687,
title = {On the Power and Limitations of Random Features for Understanding Neural Networks},
author = {Gilad Yehudai and Ohad Shamir},
journal= {arXiv preprint arXiv:1904.00687},
year = {2022}
}
备注
Comparison to previous version: Fixed a bug in Theorem 3.4 about approximating polynomials as an expectation of random features. Also added another assumption on the activaion function in theorem 3.1