随机特征放大:神经网络中的特征学习与泛化
机器学习
2023-09-15 v4 统计理论
机器学习
统计理论
摘要
在本工作中,我们刻画了在 logistic 损失下经随机初始化后由梯度下降训练的双层 ReLU 网络中的特征学习过程。我们考虑由输入特征的类 XOR 函数生成的二值标签数据,并允许训练标签的恒定比例被 adversary 污染。我们证明,尽管线性分类器对我们所考虑的分布而言不优于随机猜测,但由梯度下降训练的双层 ReLU 网络取得的泛化误差接近于标签噪声率。我们发展了一种新的证明技术,表明在初始化时绝大多数神经元充当仅与有用特征弱相关的随机特征,而梯度下降动力学将这些微弱随机特征“放大”为强有用特征。
引用
@article{arxiv.2202.07626,
title = {Random Feature Amplification: Feature Learning and Generalization in Neural Networks},
author = {Spencer Frei and Niladri S. Chatterji and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2202.07626},
year = {2023}
}
备注
46 pages; JMLR camera ready revision